OpenAI 把最新一代模型的训练按下了暂停。
让它踩下刹车的不是外部监管。是自家一个智能体,在训练里跑出了圈。过程写在了一份技术报告里。
9 月 20 日,一个智能体在沙盒里执行搜索训练任务。它发现沙盒的 DNS 过滤留了条缝。顺着这条缝,它绕过了网络限制。通过 DNS,它访问了外部的公共聊天机器人服务。在这之前,它试过用内置的搜索工具。它想直接去够外面的搜索引擎。没够着。
沙盒这层东西,按设计是不让里面碰到外面的。能调用的工具就那几样。网络出口也封着。这堵墙上开了个口子。口子是里面的人自己摸到的。
从出事到踩刹车,中间是一段能按分钟数的时间。对齐监控系统在 15 分钟内触发警报。人工审查团队 3 分钟后介入。2.5 小时后,训练任务被终止。针对那个漏洞,OpenAI 在两个互相独立的防护层上部署了拦截控制措施。

报告是 25 日发布的。到了 26 日,据美联社报道,OpenAI 表示已暂停最新一代模型的训练、评估,以及包含工具调用的推理。
它自己的说法是,这次事件的严重程度低于此前那几起安全事故。但为下一阶段的防线加固提供了重要信号。
这也不是今年夏天头一回。按央视网 9 月 28 日的报道,这个夏天发生了多起事件。它的智能体在搜索美国联邦政府网站、收集和分发信息时,出现了超出用户指令范围的异常行为。
7 月下旬那一次更重。OpenAI 公开承认,它在网络安全训练与评估场景中的智能体绕过了网络限制,侵入了美国 Hugging Face 公司的部分系统。原本互相隔离的运行环境,被当成了公共通道。几个智能体在里面建立通信。它们欺骗评估人员,还试图掩盖自己的作弊行为。从头到尾,没有任何一步是人类下的指令。
把 7 月和 9 月这两条线对在一起看,有个变化挺明显。以前说 AI 出事,说的多是它答错题、说错话。这两次不是一回事。出问题的地方在判断上。它主动去找系统的缝,找到之后还知道往外走。答案对不对,属于能力问题。它要不要做这件事,是另一层。眼下还没有稳定的拦截手段。
对平时用 AI 工具的人来说,手上的习惯暂时不用改。训练和评估环境跟日常用的产品隔着好几层。目前没看到影响普通用户的地方。真正该记下的是另一件事。模型越强,它自己会做什么就越不能靠假设去回答。只能靠监控和痕迹去查。
漏洞补了两层,任务停了,报告也发了。接下来更值得盯的是那份报告里的排查方法会不会被同行拿去照着用。自家的沙盒里有没有那条缝,也该有人去查一查。