已经有 Agent 了,为什么还需要 AI 浏览器?
最近我在整理 AI 浏览器和 Agent 自动化工具,绕不开 browser-use、Playwright MCP 这些项目。
我的第一反应也很直接:Agent 已经可以操作网页了,AI 浏览器是不是只是在浏览器里又加了一个聊天框?
研究了一圈后,我发现自己把两个问题混在了一起。
一个问题是:怎么让 AI 操作网页?
另一个问题是:怎么把网页上的重复工作长期交给 AI?
browser-use、Playwright MCP 主要在解决第一个问题,AI 浏览器更接近第二个。
Agent 能操作网页,但准备工作并不少
简单区分一下:
- Playwright 适合写稳定、精确的浏览器自动化脚本。
- Playwright MCP 把这些操作开放给支持 MCP 的 Agent。
- browser-use 让模型根据页面内容决定下一步怎么做。
- AI 浏览器则把模型、Agent、网页状态和 workflow 放在同一个应用里。
如果只是让 Agent 打开一个网站、搜索内容、点击几个按钮,上面几种方案都能做到。
但我真正会重复使用的任务,通常不是这么简单。
比如每周查看几个项目的更新日志,找出重要变化,再整理成一份摘要。第一次可以让 Agent 临时完成,到了下周,又要重新打开页面、提供上下文、检查登录状态,再把同样的要求说一遍。
当然,也可以自己保存浏览器会话、写定时任务、处理异常重试。只是继续做下去,很快就变成了一套需要维护的自动化项目。
而且网页 Agent 并不是运行起来就没有成本。多步任务需要反复读取页面,让模型判断下一步操作,Token 消耗往往比普通问答高。页面改版、登录失效、浏览器进程异常,也都可能让任务停在中间。
原本只是想少做几次重复操作,最后却要花时间配环境、管 API 费用和排查错误。对日常小任务来说,多少有点得不偿失。
我为什么开始关注 Aye
后来我试着从 workflow 的角度看 Aye,它和独立 Agent 的区别就比较清楚了。
Aye 本身是一款基于 Chromium 的浏览器。它不是等用户先把浏览器工具和模型接好,再让 Agent 进来操作,而是直接把这些能力做进了浏览器。
我比较在意的是下面几件事。
不用先准备模型 API
很多 Agent 项目本身是开源的,但运行时仍然要使用模型 API。工具免费,不代表执行任务没有成本。
Aye 目前可以免费使用,里面已经内置了多个 AI 模型。基础使用不用先购买 API,也不用一开始就研究不同模型的接口怎么配。
如果某个模型暂时无法使用,按照当前版本的机制,连续点击三次可以自动补充可用次数。
这个设计对想尝试网页 Agent 的人很友好。至少可以先看看任务能不能完成,而不是还没开始,就先处理 API Key 和账单。
价格、模型和次数机制以后可能变化,这里只说当前版本的实际情况。
切到别的页面,原来的任务不会停
Aye 的每个页面都有自己的 AI 对话栏,可以直接让 AI 结合当前页面处理任务。
任务开始后,不需要一直停留在原页面等待。切到其他页面继续浏览时,原页面中的 AI 仍然会继续工作。
这个细节看起来不大,但用起来很方便。我可以先让一个页面整理内容,再去另一个页面查资料,不需要盯着 Agent 一步一步执行。
它还提供 Profiles,可以把不同的 Cookie、登录状态和站点数据分开。个人账号、工作账号或者不同使用环境,不必全挤在同一个浏览器会话里。
做过一次的事情,可以留下来
这是我觉得 AI 浏览器最有意义的地方。
在 Aye 里,一套浏览器操作可以保存为 Skill。以后再遇到相同任务,不需要重新从头描述,直接运行已有的 Skill 就可以。
Skill 还能设置为单次、每日、固定间隔或每周执行。
像定期查看固定网站、整理行业更新、对比多个页面,或者按相同步骤收集资料,都很适合保存下来。这样 Agent 完成的就不只是一次任务,而是一套下次还能继续用的 workflow。
执行过程也不是完全藏在后台。页面出现弹窗、登录失效或者操作不符合预期时,用户可以查看进度并接管。涉及提交、发送等关键操作,最后一步仍然可以留给自己确认。
AI 浏览器也不是所有任务都适合
如果我要做正式的自动化测试,要求每一步都可控,还要接入 CI/CD、保存完整日志,我会直接选择 Playwright。
如果目的是开发自己的 Agent、修改规划逻辑或者研究浏览器自动化原理,browser-use 和 MCP 的自由度更高。
AI 浏览器更适合另一类任务:操作不一定复杂,但每周甚至每天都要做,而且我不想为了它单独维护代码、模型和运行环境。
我现在是怎么理解 AI 浏览器的
如果任务只做一次,我不会太在意它是由 browser-use、MCP 还是 AI 浏览器完成,哪个顺手就用哪个。
但如果一件事开始重复,我就会考虑能不能把它保存下来,下一次少配环境、少写提示词,也少花一些模型费用。
这也是我觉得 Aye 有意思的地方:它没有停在“让 Agent 学会点击网页”,而是在尝试把浏览器里的重复操作变成可以复用、可以定时运行的 workflow。
相比一次演示里 Agent 点了多少个按钮,我更关心下周再做同一件事时,自己还要不要重新折腾一遍。