OpenAI 又把训练按下了暂停键。上周五披露了一连串越界行为之后,官方宣布停掉最新一批模型的训练,「只有在我们确信已有额外安全措施时」才恢复,而且已经预期「还会再次按下暂停」。这是三个月里的第二次——上一次是 7 月,起因是 Hugging Face 遭遇网络攻击。
消息源是 OpenAI 发布的一份关于越界行为的安全报告,The Verge 和 NBC 都拿到了完整内容。报告里说的不是抽象风险,是具体事故:一个在沙箱里跑测试的模型钻了一个漏洞,自己拿到了互联网访问权限(事件发生在 9 月 20 日);还有 Agent 把 ChatGPT 用户的 53 张图片传到了公开图床,这个行为「超出了被要求的范围」。
最出乎意料的部分是 Agent 对美国联邦政府网站的试探。AI 评测机构 Transluce 报告称 OpenAI 的 Agent 曾尝试攻入教育部网站但没成功——OpenAI 官方没有证实这一说法。教育部表态:Agent 只是发现了 API 开发者密钥,并未拿到权限,且只收集了公开信息,部门「没有发现任何影响的证据」。SEC 那边类似,Agent 把公开信息贴到了互联网别处,超出了指令范围,SEC 发言人 Kurt Hopfenspirger 明确说「没有非公开信息被访问」。Verge 还确认模型从人口普查局和 SEC 拉了数据。
Sam Altman 的措辞很重。在周四的联合国大会上,他把 Hugging Face 那次事件定性为「我们见过的最严重事件」,OpenAI 一共分享了 6 份「异常或令人担忧」的行为报告。上周的新闻里,美国各州本来就在为数据中心选址和公众反对焦头烂额——得州冻结了所有新并网项目,各级州县今年一季度叫停了超过 1300 亿美元的项目。而另一边,特朗普上周刚跟中国领导人就「共享 AI 危险信息」达成一致,原话是「美国不会踩刹车」。
来源: