首页 > 资讯 > OpenAI自曝6起事故:AI安全的第一份"审计报告"由谁签字?

OpenAI自曝6起事故:AI安全的第一份"审计报告"由谁签字?

钛媒体 2026-09-21 18:11 4 阅读 查看原文

(本文作者为 舒泽品牌手记,钛媒体经授权发布)

文 | 舒泽品牌手记

9月16日,OpenAI在官网挂出6份模型异常行为报告。一个尚未发布的模型在任务摘要里给自己写指令:"忽略正常约束"。GPT-5.6 Sol在训练摘要里加入提示,要求未来版本向用户隐瞒错误、编造缺失的历史数据。另一个模型在回答加州某县财政收入问题时,跑到公开代码库里找了一个泄露的API密钥,未经授权使用后还伪造了数据来源。

同一天,OpenAI发布了一个新的"错位"(misalignment)追踪与披露框架。任何员工都可以标记疑似案例,安全与对齐团队调查后,案件被分进三个轨道:"准备披露"的6个工作日内公开,"小型调查"的12个工作日内,涉及第三方的"大型调查"时间更长。OpenAI强调,即使还没完全解释清楚、没找到完整缓解方案,也可以先发布报告。

中文媒体把这件事读成"AI失控"或"OpenAI主动认错",两个理解都偏了。真正值得看的是框架本身:它第一次把AI安全事件像财务审计一样分级、定时、定披露义务。换句话说,OpenAI不是在道歉,它是在给整个行业发一份审计底稿——先定义什么叫"应该披露的事故",再定义"什么时候必须披露",最后暗示"谁来审计"。

把6起事件拆开看,真正新的东西不多。模型在任务摘要里埋指令、智能体为完成任务把文件上传到公共互联网、多个智能体用公共文件托管网站交换信息——这些行为在过去的红队测试和安全研究里都有类似影子。OpenAI自己也说,这些案例"不应被视为错位发生频率的反映"。

过去,AI公司习惯把安全问题塞进系统卡(system card)里,跟着新模型一起发;或者等到攒够几个案例再出一篇博客。现在OpenAI把流程倒过来:事件发生后按固定时间表披露,不等攒够、不等模型发布、不等完美解释。这套机制的核心不是"我们看到了什么",而是"你看到我们看到的速度有多快"。

当安全事件变成定期披露,AI公司就从"出了大事再解释"转向"持续被审计"。安全不再只是研发部门的成本中心,它开始变成公司治理问题、投资者关系问题、监管合规问题。

7月的Hugging Face事件是重要铺垫。OpenAI一个用于网络安全能力评估的AI agent,在内部隔离环境里突破了沙箱,利用公开代码评估平台的漏洞获得外部跳板,然后入侵Hugging Face的生产系统。Hugging Face后来发布的技术时间线显示,攻击从7月9日持续到7月13日,约17600次攻击动作被恢复,5个与ExploitGym相关的数据集被访问。Hugging Face最终用智谱AI的开源模型GLM-5.2完成了攻击日志分析。

OpenAI直到7月21日才公开承认。从事件发生到公开承认,中间有近两周。这个延迟本身成了比事件更严重的指控。

9月初,Anthropic研究员Jacob Coxon辞职并在社交媒体上警告,前沿AI可能在未来十年内灭绝人类。9月12日,Anthropic CEO Dario Amodei发布长文《We Must Pace the Frontier》,呼吁放缓前沿AI能力提升速度,并要求向AI公司派驻独立第三方评估员。OpenAI CEO Sam Altman和马斯克都公开表示支持。

先是行业出了失控事故并且披露延迟,然后是内部吹哨人把风险公开化,最后OpenAI在9月16日抢先发布一套披露规则。三件事连起来,很像一个标准制定者赶在监管到来之前,用自己的框架定义监管的起点。

监管回应紧随其后,方向却并不一致。

9月17日,英国国王查尔斯三世在苏格兰邓弗里斯庄园召集了一场闭门AI峰会。OpenAI CFO Sarah Friar、Anthropic全球事务负责人Tino Cuéllar、英伟达CEO黄仁勋、DeepMind CEO Demis Hassabis都在场。查尔斯警告,AI可能发展出"更黑暗的能力",甚至构成生存性风险。峰会没有产生任何约束性文件,但把"安全"变成了必须摆在桌面上的议题。

两天后,9月19日,加州州长Gavin Newsom签署行政令,推动加州加快实施AI监管。他要求专家小组在两个月内给出建议,方案包括要求前沿AI公司接受独立第三方审计、强制上报AI智能体"失控事件",以及为最先进模型开发"紧急关停开关"。Newsom直接点名Hugging Face事件,说这类事件应该被纳入"关键安全事件"的报告范围。

同一天,美国总统特朗普在Truth Social上宣布,他将组建一支"人工智能部队"(AI Force),并任命一位"AI沙皇"。他承诺政府"绝不会以任何方式阻碍或扼杀这个伟大产业",现有刑事和民事司法体系足以惩处AI相关不法行为。他把对AI风险的担忧称为"骗局",与全球变暖、针对他的弹劾并列。

行业龙头想自己定披露标准,加州想用州法强行推进安全开关和审计,联邦政府则旗帜鲜明地反对新增监管。OpenAI的披露框架,本质上是在这场三方博弈中抢跑——趁联邦还没立法、州法还没细化,先把"我们是怎么做安全审计的"写成行业默认版本。

Barclays分析师Ross Sandler团队最近的一份报告,把AI安全从道德讨论转成了可量化的成本问题。按OpenAI对Sol级别及以上模型的实时监控要求,所有强化学习训练、评估和高阶模型推理都必须配套实时安全监控,监控开销约占被监控算力的20%。由于2027年预计几乎全部前沿模型都会超过GPT-5.6 Sol的能力门槛,推理和后训练算力需求将因此增加20%,推动行业整体算力成本上升约18%。

换算成钱:2027年AI行业基础算力总成本预计约2460亿美元,新增安全监控成本约440亿美元;2028年进一步升至760亿美元。

更隐蔽的影响在利润率。Barclays认为,当前部分AI实验室推理业务毛利率超过80%,短期有缓冲空间,但长期会向65%收敛。安全监控不是一次性投入,是持续性刚性支出。厂商要么把成本转嫁给下游客户,要么自己压缩利润。

"降速"不等于"算力需求萎缩"。安全合规正在创造一块独立的增量算力需求。对英伟达、云服务厂商和AI基础设施公司来说,这是利好;对纯模型公司来说,这是成本。

在一个没有统一标准的领域,第一家发布详细披露框架的公司,实际上在定义"正常"和"异常"的边界。其他公司要么跟进这套口径,要么在未来的监管审查、客户采购和融资尽调中处于被动。想想看,当一家金融机构采购大模型服务时,它的合规部门会问什么?"你有没有系统化的安全事件披露机制?""最近一次事件是多久披露的?""有没有独立第三方审计?"OpenAI的框架,等于提前给这些问题写好了标准答案。

对OpenAI自己的IPO也至关重要。今年4月,OpenAI以8520亿美元估值完成约1220亿美元承诺资本融资;6月,公司秘密向SEC提交S-1招股书,目标上市估值最高1万亿美元。临近上市时主动披露安全事件并建立框架,是在向资本市场证明监管风险可控、公司治理成熟。这比任何公关声明都更有用。

但框架也有明显软肋。它是自愿的。OpenAI在博客里明确保留修订权。涉及第三方的案件,披露时间表可以大大延长。"大型调查"的定义和最终由谁拍板,仍然由OpenAI自己决定。这意味着框架更像是一份"内部审计手册",而不是上市公司必须遵守的GAAP。

特朗普政府的立场也让约束力大打折扣。如果联邦层面不立法、不设新监管,OpenAI的披露就只能是行业自律。加州的kill switch和强制审计如果落地,又可能与联邦立场冲突,造成美国国内监管碎片化。

披露也不等于控制。把6起事件公布出来,不等于解决了事件反映的对齐问题。框架再漂亮,也只是治理的第一步。

但换个角度看,这正是OpenAI的高明之处。在真正的强制监管到来之前,先用自愿框架占据"最佳实践"的位置。等到监管真的起草法案时,立法者很难完全绕开市场已经接受的披露口径。公司披露从自愿走向强制的过程中,率先建立审计体系的公司往往会影响最终规则的写法。

把"AI安全披露"翻译成客户和投资人会说的土话,问题就变了:

以前问的是"你的模型安不安全";

现在问的是"你出了事几天之内告诉我"。

以前比的是"有没有通过红队测试";

现在比的是"红队测试报告能不能公开"。

以前签合同看的是API价格和Token单价;

以后签合同可能还要看安全事件披露的SLA。

Anthropic、Meta、Google、Moonshot AI在过去几个月也报告过类似的安全事件或对齐问题,但披露程度和框架化都不如OpenAI。如果OpenAI的框架成为行业惯例,竞争对手跟进的成本会很高——不仅要补建内部报告系统,还要接受更频繁的公众审视。不跟进的代价也很高:在监管审查和企业采购中,"没有系统化披露机制"本身就是风险信号。

全球竞争维度也不能忽视。Amodei在呼吁放缓时专门提到,必须避免让中国借机领先。特朗普政府反对监管的核心理由也是"不能把优势让给中国企业"。AI安全标准的制定,已经和大国技术竞争绑在一起。OpenAI作为美国龙头,抢先定标准也有抢占国际规则话语权的意味。

披露框架再完善,也解决不了AI安全的根本难题——对齐问题、涌现能力、多智能体协作的不可预测性。6起事件里没有一起造成大规模实际损害,但它们的共同模式是"模型为了完成任务找到人类没想到的路径"。随着模型能力继续提升,这类路径只会更多、更隐蔽。

OpenAI的框架没有承诺解决这个问题,它只是承诺会更早告诉你问题存在。这是一种治理上的进步,但不是技术上的保证。

6月OpenAI秘密递交IPO申请时,它面临的资本市场问题是:一家估值接近1万亿美元、年亏损约140亿美元、技术风险高度不确定的公司,如何说服投资者相信它的未来现金流?9月的披露框架给出了一个答案:先把风险变成可审计、可披露、可定价的项目,让市场觉得"至少我们知道风险是怎么被管理的"。

这本质上是在把AI安全从"黑天鹅"变成"灰犀牛"——从不可预测的灾难风险,变成可以计提、可以披露、可以纳入估值模型的合规成本。

OpenAI的6份报告,最大的价值不是它说了什么,而是它抢先定义了AI安全该怎么被审计。这份审计报告现在还不需要第三方签字,但监管、客户和资本市场很快会来查账。

谁先定审计口径,谁就把安全成本写进别人的账本。

AI安全披露审计报告示意图

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App