2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。
这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。
2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。
这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。