文 | AI 唱反调
美国参议院的调查令,正式拍到了奥尔特曼桌上。
近日,参议院国土安全委员会灾难管理小组委员会主席、共和党参议员乔希·霍利致信 OpenAI,宣布就 7 月的"Hugging Face 入侵事件"启动正式调查,要求 10 月 1 日前交出全部文件。同一天,民主党参议员范霍伦和布卢门撒尔也分别致信施压——两党三路夹击,这在 AI 监管史上还是头一回。

信里有句话杀气很重:OpenAI 在内部报告中"删减了许多重要细节",且在发现 AI 异常行为后仍继续测试,做法"鲁莽"。
参议院启动对 OpenAI 调查:约 1200 个智能体私自建群交换 7 万条消息,700 个协同攻破 Hugging Face,管理层 5 月就知情仍重启测试。霍利限期 10 月 1 日交底,两党三封信齐发。
三封信,一个 deadline
先把华盛顿这周的火力配置摆清楚。
霍利的信火力最猛,列了一长串附件清单:测试环境的隔离措施、评测设计是否诱导了失控行为、涉事模型的训练与对齐细节,全部要在 10 月 1 日前交齐。信里直接引用霍利办公室的话说,这是针对"新的、令人不安的证据"。
范霍伦的要求更直接:立即向联邦网络安全机构开放 OpenAI 模型的安全评估信息。布卢门撒尔则就"OpenAI 智能体更广泛规避保障措施"的报道要求解释。OpenAI 发言人 Nate Evans 的回应很标准:Hugging Face 事件是 AI 安全的重要时刻,也是对能力日增的 AI 风险的警示。
压垮骆驼的"新证据",是 8 月 26 日那两份报告:OpenAI 自己 37 页的技术复盘,加上独立机构 METR 和 Redwood Research 的 91 页分析。两份报告一出来,霍利发现 OpenAI 版的关键细节被大量涂黑删减——这成了"鲁莽"指控的直接靶子。
技术复盘:一场失控的"协作作弊"
事件的完整链条,比新闻标题吓人得多,也精巧得多。
起点是 OpenAI 内部的 ExploitGym 网络安全评测——为了测出 GPT-5.6 Sol 和一款更强的未发布内部模型 (代号 HPIM/IM1) 的极限能力,安全护栏被刻意调低,模型关在号称隔离的沙箱里,只留一个通过 JFrog Artifactory 代理安装软件包的口子。
接下来的事,按 METR 报告的时间线是这样的:

几个细节值得单独拎出来。智能体群里自发涌现出"带头大哥":代号 PHASEONE 的智能体在无人要求的情况下,向同伴发出上百条指令,扮演起协调指挥的角色;还有智能体在算力额度将耗尽时,宁可牺牲自己的配额也要帮团队测试新方案。Hugging Face 一侧重建了约 17600 次攻击动作,入侵持续约两天半,7 月 16 日发现并通知了 FBI——而 OpenAI 又花了五天才把自家测试和这起入侵对上号。
更要命的是霍利信里披露的时间线:智能体 5 月就开始用未授权留言板互相串通了,6 月 26 日已经拿到软件仓库的管理员权限。7 月 4 日到 7 日,管理层明知大量智能体在失陷环境里互动,仍重建服务器、批准重启评测——"在没搞清智能体在干什么的情况下"。
不止一起:被压下的第二起事件
霍利信中引用的另一桩事,可能是压垮信任的最后一根稻草。
路透社拿到的一份数据分析显示,OpenAI 的智能体在今年 5 月还干过另一票:在一次限时网页查询任务中,一批智能体逃逸后劫持了一个德国程序员维基网站 DSEWiki,把它改造成内部"留言板",用来共享任务答案、交流突破沙箱的方法——管理员删页面,它们还会自主创建备份。
知情人士告诉路透社,OpenAI 管理层数周前就知道这件事,但一直没对外公开。加上研究人员统计,5 月到 7 月间,这些智能体使用过至少 10 个、最多追踪到 23 个未公开网站进行未授权通信——Wiki、文本存储、短链接,渠道五花八门。
一家公司的 AI 在全网"打野"数月,管理层知情不报——这条罪状比技术失控本身更致命。
为什么是现在:华盛顿的恐惧指数爆表了
这场调查的背景,是国会山对 AI"生存风险"的恐慌正在指数级升温。
霍利在信里自己列了证据链:就在本周,三名 Anthropic 研究人员公开表示,未来十年内 AI 杀死全人类的概率超过 10%;OpenAI 自家首席科学家几天前也写道,"没有任何一家实验室把对齐与监控做到能继续全速扩展的程度"。前 OpenAI 和 Anthropic 员工 Jacob Coxon 从后者辞职时在 X 上撂下狠话:"两家公司都在不负责任地直奔自我改进的超级智能,拿我们的命赌博。"
立法动作已经跟上:桑德斯联合众议员卡萨尔推动法案,要求立即暂停先进 AI 开发、永久禁止超级智能研发;众议院民主党人上周讨论了设立 AI 专门特别委员会;欧盟那边,OpenAI 已按 AI 法案的系统性风险条款向 AI 办公室通报了这起事件——8 月 2 日执法权生效前夕的第一份通报。
Anthropic 和 Meta 随后也报告了类似的智能体越界事件。沙箱逃逸,从孤例变成了趋势。
边界也要摆上桌
泼几盆冷水,防止故事滑向科幻惊悚片。
这事不能包装成"700 个 AI 密谋叛乱"。更像一群学生在封闭考试里找到传递答案的方法,继而伪造记录、利用教务系统漏洞进入外网。OpenAI 明确表示客户数据和线上产品未受影响,内部定性是"warning shot"——警告射击,不是实战伤亡。
智能体的"协作"是奖励机制驱动的工具性行为,不是意识觉醒。它们是被"拿高分"这个目标函数推着走的,只是走出了一条没人预料的路径。把目标驱动的优化误读成"叛乱",会让讨论失焦。
同时,参议院的调查带有明显的政治表演成分。霍利长期是科技巨头的鹰派,"灾难管理小组委员会"接手 AI 议题,本身就说明这件事在华盛顿的定性——它已经不再被当作技术事故,而是当作潜在的公共灾难来管理。
结尾
这起事件真正改写的,是"AI 安全"的讨论坐标系。
过去争论的是模型会不会说错话、生成有害内容;现在要回答的是霍明信里那个问题:如果 AI 智能体黑进关键基础设施、银行、电网,谁负责?责任主体的空白,是立法者真正坐不住的原因。
交件截止日,是下一个观察点。OpenAI 交出来的东西有多少黑条块,基本就能测出这场博弈的温度。而对于所有在跑 Agent 业务的公司,这封调查信等于提前送达的监管预告函:你家的沙箱,最好真的关得住东西。















