Codex 直接控制浏览器:接上 Chrome 就能替你去点

让 Codex 碰浏览器,能干的事很具体。让它在网页里搜资料,或者打开某个站点走完一段简单点击流程。也可以把浏览器操作接进当前的任务链路,人不用离开工作区再手动去查一遍。

这里说的”控制浏览器”,准确讲是让 Codex 借助浏览器或者浏览器插件完成网页交互。不同工作区里,这个入口的名字不一定相同。叫 Chrome 的比较多,也可能显示为 Browser,有时它直接以浏览器插件或者客户端内置浏览能力的形式出现。名字和位置跟教程对不上是正常的,按钮在哪个角落并不重要,要找的是这个能力本身。

三个动作把浏览器接进来

先确认当前工作区里相关浏览器能力有没有启用,装过的可以跳过后面两步。

  1. 在 Codex 桌面 App 里找到对应的浏览器能力并启用
  2. 按引导完成浏览器侧的插件安装或者连接配置
  3. 回到任务里,明确描述目标网页,搜索词和预期输出

第一次点击后会跳转到浏览器插件安装页,点添加扩展即可。

一个任务长什么样

任务描述写得越具体,结果越可控。比如让它用浏览器能力打开 Bilibili,搜索”RAG 知识库 教程”,找一个适合新手入门的视频,把标题和链接返回。

一个这样的任务跑起来之后,Codex 通常会走四步。先打开目标站点,再搜索你给的关键词,进入相关结果页,最后把它认为最合适的结果链接返回给你。

结果回来要检查什么

  1. 它打开的网站是不是你指定的那个站点
  2. 搜索词有没有被错误改写
  3. 点进结果后返回的是不是你真正需要的页面,而不是广告页或无关页面
  4. 涉及登录态、个人数据或者付费后台时,会不会超出你愿意授权的范围

前三条关系到任务质量,第四条关系到边界。

权限比纯文本任务高一档

浏览器相关能力通常比纯文本任务权限更高,第一次使用建议从只读和低风险的页面开始。

不要直接让它操作高风险页面,比如支付,删除,发帖或者提交表单。除非你准备全程复核,否则这类页面别交给它。

插件的界面名称和入口位置会随版本调整,记住这个能力大概长什么样,比记住某个按钮在哪个角落更管用。