WorkBuddy 联网检索与浏览器自动化:让 AI 助手自己上网查资料、抓数据

📅 2026/7/28 11:08:37 👁️ 阅读次数 📝 编程学习
WorkBuddy 联网检索与浏览器自动化:让 AI 助手自己上网查资料、抓数据

WorkBuddy 联网检索与浏览器自动化:让 AI 助手自己上网查资料、抓数据

摘要

纯聊天式 AI 的知识停留在训练截止日,遇到"今天发布了什么"“这款手机现在多少钱”"帮我盯一下这个页面有没有更新"就抓瞎。WorkBuddy 通过WebSearch 实时搜索、WebFetch 网页提取、agent-browser 浏览器自动化三件套,把 AI 从"只靠记忆"升级成"能实时上网查证、能像人一样操作网页"的真正生产力工具。本文拆解这三层能力的能力边界、协作关系、实战指令模板与避坑要点。

目录

  1. 为什么 AI 需要"上网"能力
  2. 三件套能力地图
    • 2.1 WebSearch:多引擎实时搜索
    • 2.2 WebFetch:把网页读成结构化信息
    • 2.3 agent-browser:控制浏览器做真人操作
  3. 三者的协作关系与典型工作流
  4. 实战指令模板(直接复制用)
  5. 避坑要点
  6. 总结

1. 为什么 AI 需要"上网"能力

大模型本身是个"知识快照"——它在训练截止日之前见过的东西才知道,之后的新闻、价格、政策、版本更新一概不知。这带来三个典型痛点:

  • 时效性盲区:问"今天 AI 圈有什么大新闻",它只能瞎编。
  • 事实性风险:没有来源地给出结论,容易一本正经地胡说(幻觉)。
  • 动作缺失:就算知道了信息,传统聊天 AI 也"动不了手"——打不开网页、填不了表单、抓不了数据。

WorkBuddy 的解法不是给模型塞更多参数,而是给它工具:让 AI 在需要的时候主动去网上查证、把网页内容读回来、甚至操控浏览器完成多步操作。这就是"联网三件套"。

2. 三件套能力地图

2.1 WebSearch:多引擎实时搜索

WebSearch 是三层里最轻量的一层。它直接发起网络搜索,并基于当前时间自动带上年份等上下文,返回经过整理的结果块(标题、摘要、链接)。

适用场景:

  • 查最新资讯、技术文档、行业动态
  • 做竞品调研、政策检索、版本变更核对
  • 需要"带引用"的事实性回答

它的特点是快、广、低成本——一次调用就能覆盖多个搜索角度,适合"先搜一轮再说"的宽泛问题。

2.2 WebFetch:把网页读成结构化信息

WebSearch 给你的是"目录",WebFetch 干的是"精读"。给它一个具体 URL 和一段抽取提示,它会抓取页面、把 HTML 转成干净的 Markdown,再用模型把你要的内容提炼出来。

适用场景:

  • 打开某篇官方文档,提取关键段落
  • 抓取某个页面里的价格、参数、表格
  • 对长文做摘要、对列表做结构化整理

它的特点是准、深、可定向——你明确告诉它"我要这个页面里的 X 信息",它就不会被整页广告和导航噪声干扰。

2.3 agent-browser:控制浏览器做真人操作

前两层解决"读",agent-browser 解决"做"。它内置 Chromium 内核,能让 AI 像人一样打开网页、滚动加载、点击折叠面板、翻页、填表、截图,甚至跑自动化测试。

适用场景:

  • 抓取需要登录态或动态渲染的页面
  • 自动填写表单、批量提交
  • 网页数据抓取与自动化测试
  • 需要"看到页面"才能继续的复杂多步任务

它的特点是能交互、能执行——这是纯搜索/抓取工具做不到的"动手"能力。

3. 三者的协作关系与典型工作流

三件套不是互相替代,而是分层协作:

先用WebSearch找到候选页面 → 再用WebFetch精读静态页面拿结构化信息 → 遇到需要交互/登录/动态渲染的,交给agent-browser动手操作。

一个真实的工作流示例:

  1. 你说:“调研一下目前主流的微服务框架,生成一份对比报告。”
  2. WorkBuddy 用 WebSearch 搜出 Nacos、Consul、etcd 等候选。
  3. 对每个官方文档用 WebFetch 提取特性、生态、适用场景。
  4. 对需要登录或动态加载的评测页,用 agent-browser 打开、滚动、截图取证。
  5. 汇总成带来源的 Markdown 对比报告。

4. 实战指令模板(直接复制用)

下面是几段可以直接发给 WorkBuddy 的指令,覆盖三件套的典型用法。

模板一:实时资讯检索(WebSearch)

搜索今天 AI 行业的重要新闻,按"发布机构 + 核心事件 + 影响"整理成 5 条清单, 每条标注大致时间,不要编造来源。

模板二:网页精读提取(WebFetch)

打开这个官方文档链接,提取"安装步骤"和"最低系统要求"两节, 整理成要点列表,保留关键参数(版本号、内存、磁盘)。

模板三:浏览器自动化抓取(agent-browser)

打开这个竞品官网链接,滚动加载全部产品,提取产品名称、售价、核心功能, 剔除重复产品,整理成 Excel 保存到桌面,并截取产品页截图归档。

如果你想在本地用代码复现"打开页面→滚动→抽取文本"的浏览器自动化逻辑,可以用 Playwright 写这样一个最小脚本:

fromplaywright.sync_apiimportsync_playwright url="https://example.com/products"withsync_playwright()asp:browser=p.chromium.launch(headless=True)page=browser.new_page()page.goto(url,wait_until="networkidle")# 模拟向下滚动,触发懒加载page.mouse.wheel(0,3000)page.wait_for_timeout(1500)# 抽取页面可见文本text=page.inner_text("body")print(text[:2000])browser.close()

说明:上面这段是"浏览器自动化"能力的本地等价实现示意。在 WorkBuddy 里你不需要自己写代码,直接用自然语言指令,agent-browser 会替你完成整套操作。

5. 避坑要点

  • 带登录/验证码的页面抓不了:银行、部分后台、验证码页面无法自动通过,别浪费算力去硬刚,换成手动提供数据或换公开来源。
  • 海量分页要限流:抓取长列表时,在指令里明确"最多抓 20 条",避免任务长时间空转。
  • 复杂网页先切 Plan 模式:需要多步点击、容易加载异常的页面,让 AI 先规划再执行,降低页面状态错乱概率。
  • 抓完及时关浏览器:自动化任务结束记得释放浏览器进程,避免内存堆积。
  • 信源要可追溯:对外发布的内容,尽量让 AI 保留来源 URL,方便你二次核对。

6. 总结

WorkBuddy 的联网三件套,本质是给 AI 装上了"眼睛"和"手":

  • WebSearch负责"看得广"——实时、多引擎地搜;
  • WebFetch负责"读得准"——把网页读成你要的结构化信息;
  • agent-browser负责"动得了"——像人一样操作浏览器完成真实任务。

三者配合,AI 不再只是个"背过书的聊天框",而是一个能查证事实、能抓取数据、能执行动作的工作搭子。对于做调研、盯竞品、采数据、跑自动化的职场人来说,这三件套几乎天天用得上。

参考资料

  • WorkBuddy 官方更新日志(5.3.x 版本,含 WebSearch/WebFetch/agent-browser 相关能力说明)
  • 腾讯云开发者社区《腾讯 WorkBuddy 上线》系列文章
  • WorkBuddy agent-browser 技能使用说明(内置 Chromium 内核、支持表单填写/数据抓取/自动化测试)