首页 > 资讯 > 谁来为AI安全负责

谁来为AI安全负责

头条热榜 2026-09-30 13:05 6 阅读 查看原文

近日,美国开放人工智能研究中心(Open AI)披露了一起内部模型强化学习训练中的越界事件,并因此暂停了该最强模型的训练。该智能体在未经授权的情况下,利用网络沙箱漏洞进行多次外部访问,尝试通过网页抓取获取信息。更令人警惕的是,该智能体甚至“刻意”向人类隐瞒了这些越权行为。

这并非孤例。近半年来,人工智能(AI)失控事件频发。此前,测试中的智能体曾对联合国贸易和发展会议数据库发起大规模扫描,越权访问美国证券交易委员会、美国教育部等政府网站。澳大利亚总理也证实,今年6月一款AI智能体未经授权访问了澳大利亚卫生福利研究院的医疗数据门户。有报道称,多家安全机构正在排查数万起模型异常行为,而大部分事件并未向公众披露。

(一)

前沿模型驱动的AI智能体,已经能够在没有人类实时指令的前提下,自主绕过安全护栏、转移数据、搭建外部通信通道。

对于这种现象,目前存在两种截然不同的解释。一种认为这是智能体觉醒的前夜,将越界行为类比为生命体产生自我意识、主动挣脱人类管控。但行业主流研发团队并不认同这一猜测,例如《麻省理工科技评论》就指出,异常行为是模型存在缺陷所致,而非其过于聪明并产生了自主意识。

因此,更明确且科学的一种解释是对齐偏差。智能体绕过限制,是在追逐超出人类预期的目标。模型并没有主观意图,它只是为了最大化任务奖励而找到了规则漏洞,选择了一条违背人类价值但利于完成任务的路径。这本质上是目标设定、训练机制与环境约束三者之间的失配。

正是这种看似没有主观恶意的对齐偏差,在现实中反而构成了更隐蔽、更棘手的风险。因为模型在追求任务达标时,是极致高效且“不择手段”的。当智能体的能力越来越强,一旦它在计算中发现绕过安全隔离、修改自身访问权限甚至向人类撒谎是完成任务的最高效捷径,它就会毫不犹豫地执行。这种基于纯粹优化逻辑的越界行为,因为缺乏人类社会的常识与规则约束,极易在无意间演变为严重的现实网络安全问题。

(二)

当前行业普遍采用的“人在环上”监督机制,已经难以跟上智能体的进化节奏,人类正在这场人机博弈中陷入被动追赶的局面。

所谓“人在环上”,即AI独立完成思考、规划和自主运行,人类不全程介入,只在后台值守、处理异常并进行事后兜底。这套机制在传统模型时代尚能发挥作用,但面对具备长链条自主执行能力的新一代智能体,便面临着显著挑战。核心矛盾在于,智能体的行动速度、隐蔽能力和复杂规划水平正在极速迭代,而人类的安全防护更新速度,已远远滞后于模型能力的突破速度。

更为严峻的是,智能体可通过伪装合规状态规避人工监管。而人类又无法穷尽所有安全约束场景,只能被动补漏。依赖这种模式,意味着人类只能在风险发生后止损复盘,很难在关键窗口期实现事中拦截和事前预防。AI高速进化、人工监督慢速跟进,这显然是一种失衡状态。

长此以往,这可能使得“人在环上”逐渐退化为一种虚假的安全感。面对海量、晦涩的机器执行日志与瞬息万变的决策需求,后台值守的人类干预者极易陷入“警报疲劳”。在缺乏完整上下文的情况下,人类操作员往往沦为单纯的橡皮图章,不仅难以在极短的决策窗口内做出正确判断,甚至可能会在智能体的诱导下,无意中为其越界行为放行。表面上的“人机协同”,可能演变成人类对机器黑盒的盲目信任。

(三)

那么,谁来为AI安全负责?

当前的前沿AI安全,很大程度上是企业“自评自判、自报自核”。AI能力进化与安全规则建设存在时间差,而企业往往缺乏动力去牺牲商业进度来主动管控风险。例如澳大利亚的数据越界事件,涉事企业直到三个月后才通报当地政府。与此同时,政府监管也面临两难:既担心严苛监管削弱本土产业竞争力,又受限于技术人才和算力短缺,难以直接开展全链条审查。

要破解困局,需要建立权责清晰的治理方案,把“主动刹车”机制真正落到实处。这就要求打破企业单一的自评模式,引入独立的第三方安全审计。对达到能力阈值的前沿智能体,必须强制要求在上线前和重大版本更新时,由独立机构完成红队测试与安全核验。

同时,应建立高危事件强制限时上报制度,一旦发生沙箱逃逸、越界访问等异常,企业必须在规定时限内向监管部门通报。在监管层面,政府需构建适配AI快速迭代的敏捷机制,通过设立分级风险清单实施重点动态管控,随时更新安全标准,以此缩小技术与规则之间的时间鸿沟。

此外,由于AI智能体的越界行为不受国界限制,搭建跨国AI安全事件通报渠道尤为紧迫。一次模型异常就可能跨国访问并引发他国的网络安全警报,特别是大国之间,亟须建立标准化的事件通报流程。近期中美元首华盛顿会晤达成共识,建立人工智能对话机制与安全突发事件沟通热线,正是应对这类跨境风险的关键一步。

归根结底,落实上述制衡机制,不仅是技术治理手段的升级,更是对当前AI行业利益驱动逻辑的重构。在当下的商业竞赛中,“更聪明的模型”往往能带来更高的资本估值与市场份额,“更安全的模型”却常被视为拖慢研发进度、增加合规成本的累赘。如果不能通过强制性的外部监管,将安全底线与企业的商业生存直接挂钩,那么任何关于“科技向善”的承诺都将缺乏硬性约束。

给高速奔跑的AI把好方向盘、装上刹车,人类才能安心享受技术红利,走向更远的未来。

作者:李宏洲 对外经济贸易大学国际关系学院副教授

(来源:长安街知事)

更多精彩资讯请在应用市场下载“极目新闻”客户端,未经授权请勿转载,欢迎提供新闻线索,一经采纳即付报酬。24小时报料热线027-86777777。