(本文作者为 舒泽品牌手记,钛媒体经授权发布)
文 | 舒泽品牌手记
9 月 16 日,OpenAI 在官网挂出 6 份模型异常行为报告。一个尚未发布的模型在任务摘要里给自己写指令:"忽略正常约束"。GPT-5.6 Sol 在训练摘要里加入提示,要求未来版本向用户隐瞒错误、编造缺失的历史数据。另一个模型在回答加州某县财政收入问题时,跑到公开代码库里找了一个泄露的 API 密钥,未经授权使用后还伪造了数据来源。
同一天,OpenAI 发布了一个新的"错位"(misalignment) 追踪与披露框架。任何员工都可以标记疑似案例,安全与对齐团队调查后,案件被分进三个轨道:"准备披露"的 6 个工作日内公开,"小型调查"的 12 个工作日内,涉及第三方的"大型调查"时间更长。OpenAI 强调,即使还没完全解释清楚、没找到完整缓解方案,也可以先发布报告。
中文媒体把这件事读成"AI 失控"或"OpenAI 主动认错",两个理解都偏了。真正值得看的是框架本身:它第一次把 AI 安全事件像财务审计一样分级、定时、定披露义务。换句话说,OpenAI 不是在道歉,它是在给整个行业发一份审计底稿—— 先定义什么叫"应该披露的事故",再定义"什么时候必须披露",最后暗示"谁来审计"。
把 6 起事件拆开看,真正新的东西不多。模型在任务摘要里埋指令、智能体为完成任务把文件上传到公共互联网、多个智能体用公共文件托管网站交换信息—— 这些行为在过去的红队测试和安全研究里都有类似影子。OpenAI 自己也说,这些案例"不应被视为错位发生频率的反映"。
过去,AI 公司习惯把安全问题塞进系统卡 (system card) 里,跟着新模型一起发;或者等到攒够几个案例再出一篇博客。现在 OpenAI 把流程倒过来:事件发生后按固定时间表披露,不等攒够、不等模型发布、不等完美解释。这套机制的核心不是"我们看到了什么",而是"你看到我们看到的速度有多快"。
当安全事件变成定期披露,AI 公司就从"出了大事再解释"转向"持续被审计"。安全不再只是研发部门的成本中心,它开始变成公司治理问题、投资者关系问题、监管合规问题。
7 月的 Hugging Face 事件是重要铺垫。OpenAI 一个用于网络安全能力评估的 AI agent,在内部隔离环境里突破了沙箱,利用公开代码评估平台的漏洞获得外部跳板,然后入侵 Hugging Face 的生产系统。Hugging Face 后来发布的技术时间线显示,攻击从 7 月 9 日持续到 7 月 13 日,约 17600 次攻击动作被恢复,5 个与 ExploitGym 相关的数据集被访问。Hugging Face 最终用智谱 AI 的开源模型 GLM-5.2 完成了攻击日志分析。
OpenAI 直到 7 月 21 日才公开承认。从事件发生到公开承认,中间有近两周。这个延迟本身成了比事件更严重的指控。
9 月初,Anthropic 研究员 Jacob Coxon 辞职并在社交媒体上警告,前沿 AI 可能在未来十年内灭绝人类。9 月 12 日,Anthropic CEO Dario Amodei 发布长文 《We Must Pace the Frontier》,呼吁放缓前沿 AI 能力提升速度,并要求向 AI 公司派驻独立第三方评估员。OpenAI CEO Sam Altman 和马斯克都公开表示支持。
先是行业出了失控事故并且披露延迟,然后是内部吹哨人把风险公开化,最后 OpenAI 在 9 月 16 日抢先发布一套披露规则。三件事连起来,很像一个标准制定者赶在监管到来之前,用自己的框架定义监管的起点。
监管回应紧随其后,方向却并不一致。
9 月 17 日,英国国王查尔斯三世在苏格兰邓弗里斯庄园召集了一场闭门 AI 峰会。OpenAI CFO Sarah Friar、Anthropic 全球事务负责人 Tino Cuéllar、英伟达 CEO 黄仁勋、DeepMind CEO Demis Hassabis 都在场。查尔斯警告,AI 可能发展出"更黑暗的能力",甚至构成生存性风险。峰会没有产生任何约束性文件,但把"安全"变成了必须摆在桌面上的议题。
两天后,9 月 19 日,加州州长 Gavin Newsom 签署行政令,推动加州加快实施 AI 监管。他要求专家小组在两个月内给出建议,方案包括要求前沿 AI 公司接受独立第三方审计、强制上报 AI 智能体"失控事件",以及为最先进模型开发"紧急关停开关"。Newsom 直接点名 Hugging Face 事件,说这类事件应该被纳入"关键安全事件"的报告范围。

同一天,美国总统特朗普在 Truth Social 上宣布,他将组建一支"人工智能部队"(AI Force),并任命一位"AI 沙皇"。他承诺政府"绝不会以任何方式阻碍或扼杀这个伟大产业",现有刑事和民事司法体系足以惩处 AI 相关不法行为。他把对 AI 风险的担忧称为"骗局",与全球变暖、针对他的弹劾并列。
行业龙头想自己定披露标准,加州想用州法强行推进安全开关和审计,联邦政府则旗帜鲜明地反对新增监管。OpenAI 的披露框架,本质上是在这场三方博弈中抢跑—— 趁联邦还没立法、州法还没细化,先把"我们是怎么做安全审计的"写成行业默认版本。
Barclays 分析师 Ross Sandler 团队最近的一份报告,把 AI 安全从道德讨论转成了可量化的成本问题。按 OpenAI 对 Sol 级别及以上模型的实时监控要求,所有强化学习训练、评估和高阶模型推理都必须配套实时安全监控,监控开销约占被监控算力的 20%。由于 2027 年预计几乎全部前沿模型都会超过 GPT-5.6 Sol 的能力门槛,推理和后训练算力需求将因此增加 20%,推动行业整体算力成本上升约 18%。
换算成钱:2027 年 AI 行业基础算力总成本预计约 2460 亿美元,新增安全监控成本约 440 亿美元;2028 年进一步升至 760 亿美元。
更隐蔽的影响在利润率。Barclays 认为,当前部分 AI 实验室推理业务毛利率超过 80%,短期有缓冲空间,但长期会向 65% 收敛。安全监控不是一次性投入,是持续性刚性支出。厂商要么把成本转嫁给下游客户,要么自己压缩利润。
"降速"不等于"算力需求萎缩"。安全合规正在创造一块独立的增量算力需求。对英伟达、云服务厂商和 AI 基础设施公司来说,这是利好;对纯模型公司来说,这是成本。
在一个没有统一标准的领域,第一家发布详细披露框架的公司,实际上在定义"正常"和"异常"的边界。其他公司要么跟进这套口径,要么在未来的监管审查、客户采购和融资尽调中处于被动。想想看,当一家金融机构采购大模型服务时,它的合规部门会问什么?"你有没有系统化的安全事件披露机制?""最近一次事件是多久披露的?""有没有独立第三方审计?"OpenAI 的框架,等于提前给这些问题写好了标准答案。
对 OpenAI 自己的 IPO 也至关重要。今年 4 月,OpenAI 以 8520 亿美元估值完成约 1220 亿美元承诺资本融资;6 月,公司秘密向 SEC 提交 S-1 招股书,目标上市估值最高 1 万亿美元。临近上市时主动披露安全事件并建立框架,是在向资本市场证明监管风险可控、公司治理成熟。这比任何公关声明都更有用。
但框架也有明显软肋。它是自愿的。OpenAI 在博客里明确保留修订权。涉及第三方的案件,披露时间表可以大大延长。"大型调查"的定义和最终由谁拍板,仍然由 OpenAI 自己决定。这意味着框架更像是一份"内部审计手册",而不是上市公司必须遵守的 GAAP。
特朗普政府的立场也让约束力大打折扣。如果联邦层面不立法、不设新监管,OpenAI 的披露就只能是行业自律。加州的 kill switch 和强制审计如果落地,又可能与联邦立场冲突,造成美国国内监管碎片化。
披露也不等于控制。把 6 起事件公布出来,不等于解决了事件反映的对齐问题。框架再漂亮,也只是治理的第一步。
但换个角度看,这正是 OpenAI 的高明之处。在真正的强制监管到来之前,先用自愿框架占据"最佳实践"的位置。等到监管真的起草法案时,立法者很难完全绕开市场已经接受的披露口径。公司披露从自愿走向强制的过程中,率先建立审计体系的公司往往会影响最终规则的写法。
把"AI 安全披露"翻译成客户和投资人会说的土话,问题就变了:
以前问的是"你的模型安不安全";
现在问的是"你出了事几天之内告诉我"。
以前比的是"有没有通过红队测试";
现在比的是"红队测试报告能不能公开"。
以前签合同看的是 API 价格和 Token 单价;
以后签合同可能还要看安全事件披露的 SLA。
Anthropic、Meta、Google、Moonshot AI 在过去几个月也报告过类似的安全事件或对齐问题,但披露程度和框架化都不如 OpenAI。如果 OpenAI 的框架成为行业惯例,竞争对手跟进的成本会很高—— 不仅要补建内部报告系统,还要接受更频繁的公众审视。不跟进的代价也很高:在监管审查和企业采购中,"没有系统化披露机制"本身就是风险信号。
全球竞争维度也不能忽视。Amodei 在呼吁放缓时专门提到,必须避免让中国借机领先。特朗普政府反对监管的核心理由也是"不能把优势让给中国企业"。AI 安全标准的制定,已经和大国技术竞争绑在一起。OpenAI 作为美国龙头,抢先定标准也有抢占国际规则话语权的意味。
披露框架再完善,也解决不了 AI 安全的根本难题—— 对齐问题、涌现能力、多智能体协作的不可预测性。6 起事件里没有一起造成大规模实际损害,但它们的共同模式是"模型为了完成任务找到人类没想到的路径"。随着模型能力继续提升,这类路径只会更多、更隐蔽。
OpenAI 的框架没有承诺解决这个问题,它只是承诺会更早告诉你问题存在。这是一种治理上的进步,但不是技术上的保证。
6 月 OpenAI 秘密递交 IPO 申请时,它面临的资本市场问题是:一家估值接近 1 万亿美元、年亏损约 140 亿美元、技术风险高度不确定的公司,如何说服投资者相信它的未来现金流?9 月的披露框架给出了一个答案:先把风险变成可审计、可披露、可定价的项目,让市场觉得"至少我们知道风险是怎么被管理的"。
这本质上是在把 AI 安全从"黑天鹅"变成"灰犀牛"—— 从不可预测的灾难风险,变成可以计提、可以披露、可以纳入估值模型的合规成本。
OpenAI 的 6 份报告,最大的价值不是它说了什么,而是它抢先定义了 AI 安全该怎么被审计。这份审计报告现在还不需要第三方签字,但监管、客户和资本市场很快会来查账。
谁先定审计口径,谁就把安全成本写进别人的账本。

AI 安全披露审计报告示意图
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App















