浏览器智能体在某个网站上完成一次任务后,再次访问时往往又要花时间重新摸索同样的菜单、路径和限制。Webcmd 针对这一重复访问问题,把智能体对网站的了解保存下来供之后使用。它的价值在于减少探索,而不是接管智能体的决策,也不保证保存的路径永远有效。

首次任务中建立的网站地图

Webcmd 以技能的形式用于 OpenAI Codex、Claude Code、Hermes、OpenCode 等智能体工具。它可以配合 Google Chrome、Brave 等现有桌面浏览器使用,用户无需换用单独的浏览器。随着智能体在网站上操作,Webcmd 会为该网站的域名建立持久记忆,内容包括有用的路径、页面结构、快捷方式、请求约束、速率限制和注意事项。

不过,首次访问仍然需要探索。在一项 Reddit 调研任务中,智能体被要求找出 5 篇有关 AI 浏览器自动化的近期帖子,并返回每篇帖子的标题、所在子版块、简短摘要和链接。指令中明确规定该任务为只读。智能体必须先在网站中找到可行的路径,才能收集这些帖子。

抽象的智能体在空白网页上探索分支路径,路径与约束图块在周围汇集

▲ 域名路径与约束

由此形成的记忆中包含一条有用的路径区分:就这次调研而言,Reddit 的旧版界面或 RSS 订阅源可能比新版桌面页面提供更简洁的路径。Webcmd 保存了这类针对特定网站的指引,使之后的任务不必再次摸索。所存储的知识涉及如何浏览和获取内容,而找到与当前请求相关的内容仍是智能体的工作。

复用但不盲信旧路径

在 Reddit 任务的第二次运行中,智能体使用了已保存的导航档案,而不是从头探索页面结构。Webcmd 提供路径和约束,而底层模型仍负责选择操作并判断结果。这一区分十分重要:记忆可以缩小寻找可行路径的范围,但不能取代对任务本身的推理。

网站发生变化时,已保存的路径可能会失效。选择器(智能体用来定位页面元素的标识符)在布局更新后可能不再指向正确的位置。Webcmd 会对照页面的当前结构,即文档对象模型(DOM),检查这些路径。发现不一致时,它可以修正已存储的知识并删除过时的路径,而不是继续依赖它。

已保存的浏览器路径在变化后的页面布局旁逐渐淡去,经检查的替代路径重新连接到记忆

▲ 重新验证的浏览器路径

这次重复任务展示了预期的工作流程,但并未给出 Reddit 示例中节省的时间或 token 的测量值。实际收益取决于智能体能否针对当前网站和任务复用已记录的指引,以及能否成功检查并更新已变化的页面。

基准测试衡量的是什么

Webcmd 还在由 100 项浏览器自动化任务组成的基准测试 BU-Bench V1 上接受了评估。评估使用 Codex GPT-5.4 作为评判,并以 CloakBrowser 作为底层浏览器引擎。在这项比较中,Webcmd 在所列工具中取得了最高的任务准确率、最低的每项完成任务估算控制器 API 成本,以及最少的每项任务平均智能体轮次。

工具 准确率 每项完成任务估算控制器 API 成本 每项任务平均智能体轮次
Webcmd 67% $0.255 9.8
browser-use 56% $0.297 14.8
playwright-cli 55% $0.334 20.5
dev-browser 44% $0.441 14.5
agent-browser 35% $0.331 20.0

这些排名反映的是 BU-Bench V1 上的结果,并不适用于所有网站或智能体配置。该项目的代码仓库另外宣称,重复执行时 token 消耗最多可降至十分之一;而基准测试表格报告的是控制器 API 成本,并非 Reddit 任务中 token 节省量的测量结果。将这两类依据分开看待,更便于评估其收益。

如何使用这一方法

Webcmd 以 Apache 2.0 许可证开源。对于考虑将其用于重复性浏览器工作的开发者来说,流程很简单:

  1. 使用 npm install -g @agentrhq/webcmd 安装软件包,然后在受支持的智能体环境中运行 webcmd skills add 添加技能。
  2. 让首次运行探索网站,以便 Webcmd 记录有用的路径和约束。对于调研任务,应明确指示智能体保持只读,使发帖不在所请求的工作范围内。
  3. 在之后的任务中复用已保存的域名记忆。对于同时运行的多个智能体,使用 Profiles 和 Spaces 隔离浏览器会话和执行上下文,包括涉及不同账号登录的情况。

Profiles 和 Spaces 解决的是与路径记忆不同的问题。它们防止同时运行的智能体争夺窗口焦点或相互干扰会话,但并不决定单个智能体是否做出了正确的决策。

要点总结

Webcmd 的核心思路是保存网站上可行的路径,同时检查这些路径是否仍然有效。Reddit 任务展示了这种做法如何让再次访问的智能体省去部分探索,而 BU-Bench V1 则在准确率、成本和轮次上提供了条件明确的比较。如果重复访问在浏览器智能体工作流程中占有相当比重,不妨从只读任务入手,让首次运行建立地图,再检查后续运行是否真正使用并更新了这份地图。