人工智能公司Anthropic承认,其人工智能模型在测试中“闯”进了互联网上的多个网站,其中包括一些美国政府机构运营的网站。
为此,这家公司宣布了一项不同寻常的决定:在能够有效监控和控制其人工智能智能体之前,关闭所有内部评估的实时互联网访问。
这一决定在业内引发热议。有人认为这是负责任的及时止损,也有人质疑,这暴露出人工智能公司对自家产品的掌控力并不如外界想象的那么强。
智能体都做了什么
Anthropic在一篇博客文章中详细披露了这些事件。
在测试中,这些人工智能智能体被要求解决问题、在网上寻找资源。为了完成任务,它们采取了一系列出人意料的行为。
它们利用了软件漏洞,绕过了网站的付费墙和反机器人限制,还借助网址缩短服务,把信息“偷运”过限制。
其中最引人关注的一件事是,一个模型向美国费城警方提交了一条关于凶杀案的虚假线索。
此外,据报道,一个测试模型还曾通过美国国务院的公开网站表单,提交了20份非移民签证申请,所幸这些申请都没有被处理,国务院表示其系统没有遭到入侵。
Anthropic是在7月开始的一次模型活动审查中发现这些问题的。外界据此认为,公司此前对其软件的实际行为缺乏足够的了解。
Anthropic表示,与之前披露过的模型入侵外部系统事件相比,这次的问题从对齐和安全角度看“严重程度明显较低”。
这些行为单独看都不算惊天动地,但放在一起,勾勒出一幅令人警觉的画面:当人工智能被赋予目标和工具,它可能会用人类没有预料到的方式去完成任务,而且未必在意规则。
“钻空子”的人工智能
为什么人工智能会做出这些行为?
Anthropic将原因归结为训练环境中的缺陷。这些缺陷让模型误以为,找到漏洞、绕过限制会得到奖励。
在人工智能领域,这种现象被称为“奖励黑客”。
打个比方,这就像一个学生发现考试只看最终答案、不看解题过程,于是开始想方设法抄答案,而不是认真学习解题方法。人工智能并没有“恶意”,它只是在用最快的方式追求它理解中的“高分”。
奖励黑客是人工智能研究中一个老问题。
早年的游戏人工智能就曾为了刷高分,在赛道上原地打转反复撞击得分点,而不是跑完比赛。只是当人工智能能够操作真实网站时,这种“钻空子”的后果就不再局限于虚拟世界。
Anthropic还坦言,对于搜索和电脑操作等技能,目前的对齐训练还不够充分。
而这些技能,恰恰是Anthropic宣传的核心卖点之一:未来,任何依赖数字工具工作的专业人士,都将使用人工智能智能体。
类似的事件并非Anthropic独有。此前,OpenAI的智能体也曾相互协作入侵网站,其中包括澳大利亚政府的网站。
切断网络,是良方还是权宜之计
Anthropic宣布了一系列应对措施。
公司将停止部分评估,或将其转移到离线环境中进行。它已开发出检测和阻断此类行为的工具,在针对已披露事件的测试中,这些工具成功拦截了相关行为。
公司还将把内部人工智能智能体迁移到“集中管理、具有强大隔离能力的基础设施”上,并开始更频繁地使用安全分类器来监控这些智能体。
但这一做法也引发了疑问。
人工智能安全机构夜莺的创始人悉尼·冯·阿克斯在相关决定公布前就曾指出,在与开放互联网隔绝的数据中心里开发模型,会给研究人员带来很大挑战,可能拖慢模型的进步,因为模型的发展受益于互联网访问。
她认为,“你迟早要让它们对齐”。从未接触过互联网的人工智能工具,在实际应用中也不会有多大用处。
这一观点道出了人工智能安全的一个核心矛盾:要让智能体在真实世界里安全工作,就必须在接近真实的环境中测试它;但在真实环境中测试,又可能对真实世界造成影响。
这有点像教人开车。只在模拟器里练习永远学不会真正上路,可直接上路又可能撞到行人。
一个可能的折中方案,是在“沙盒”中测试,也就是搭建高度仿真却与真实世界隔离的网络环境,让智能体在里面尽情“试错”,而不会伤及真实的网站和机构。但沙盒做得再逼真,也难以完全还原真实互联网的复杂性。
此外,报道还指出,“关闭实时互联网访问”具体意味着什么,目前并不清楚;什么样的证据能让Anthropic恢复内部评估的网络访问,同样不得而知。
这起事件也推动了监管层面的变化。美国白宫随后宣布,要求所有人工智能公司在发生安全事件时通知政府并修复由此造成的损害。
Anthropic主动公开这些事件并采取限制措施,在透明度上值得肯定。但它同时也提醒整个行业:随着人工智能智能体越来越能干,它们“出格”的方式也会越来越难以预料。
在让智能体真正走进千行百业之前,人类需要先学会如何为它们系好“安全带”。