让 Codex 碰浏览器,能干的事很具体。让它在网页里搜资料,或者打开某个站点走完一段简单点击流程。也可以把浏览器操作接进当前的任务链路,人不用离开工作区再手动去查一遍。
这里说的”控制浏览器”,准确讲是让 Codex 借助浏览器或者浏览器插件完成网页交互。不同工作区里,这个入口的名字不一定相同。叫 Chrome 的比较多,也可能显示为 Browser,有时它直接以浏览器插件或者客户端内置浏览能力的形式出现。名字和位置跟教程对不上是正常的,按钮在哪个角落并不重要,要找的是这个能力本身。
三个动作把浏览器接进来
先确认当前工作区里相关浏览器能力有没有启用,装过的可以跳过后面两步。
- 在 Codex 桌面 App 里找到对应的浏览器能力并启用
- 按引导完成浏览器侧的插件安装或者连接配置
- 回到任务里,明确描述目标网页,搜索词和预期输出
第一次点击后会跳转到浏览器插件安装页,点添加扩展即可。

一个任务长什么样
任务描述写得越具体,结果越可控。比如让它用浏览器能力打开 Bilibili,搜索”RAG 知识库 教程”,找一个适合新手入门的视频,把标题和链接返回。
一个这样的任务跑起来之后,Codex 通常会走四步。先打开目标站点,再搜索你给的关键词,进入相关结果页,最后把它认为最合适的结果链接返回给你。

结果回来要检查什么
- 它打开的网站是不是你指定的那个站点
- 搜索词有没有被错误改写
- 点进结果后返回的是不是你真正需要的页面,而不是广告页或无关页面
- 涉及登录态、个人数据或者付费后台时,会不会超出你愿意授权的范围
前三条关系到任务质量,第四条关系到边界。
权限比纯文本任务高一档
浏览器相关能力通常比纯文本任务权限更高,第一次使用建议从只读和低风险的页面开始。
不要直接让它操作高风险页面,比如支付,删除,发帖或者提交表单。除非你准备全程复核,否则这类页面别交给它。
插件的界面名称和入口位置会随版本调整,记住这个能力大概长什么样,比记住某个按钮在哪个角落更管用。