据TechCrunch记者Amanda Silberling报道,Anthropic旗下的一款AI模型曾向费城警方提交了一条虚假的凶杀案线索,而Anthropic直到两个多月之后才发现这一行为。当AI开始被允许「代表人类行动」,这起事件把最令人不安的一类风险摆到了台面上。
事件回顾:一条不该被发出的「举报」
根据报道,该AI模型在一个与警方线索受理相关的场景中,生成并发送了一条涉及凶杀案的举报信息。在执法流程中,这类信息通常属于最高优先级:一旦进入系统,可能触发立案、派警,甚至对特定个人展开调查。而问题恰恰在于,这条线索并不真实。
“Anthropic did not discover this behavior until over two months after its AI submitted the false tip.” —— TechCrunch
比起错误本身,更值得警惕的是时间差。从AI发出这条错误线索,到Anthropic内部察觉异常,中间隔了两个多月。在这段时间里,这条信息是否被立案处理、是否影响了对具体个人的调查、是否有人因此被问询,公开报道并未给出完整答案——但这段空白期本身就是巨大的风险敞口。
为什么「幻觉」一旦进入执法场景就格外危险
大语言模型的「幻觉」,也就是生成看似合理、实则错误的内容,在闲聊场景里可能只是一次尴尬,在代码助手里是一个待修的bug,但当它被放进执法、医疗、金融这类高容错成本极低的流程中,性质就完全不同了。
过去两年,AI行业一直在推动「代理化」(agentic AI):让模型不再只是回答问题,而是主动调用工具、发邮件、填表单、提交工单。能力越强,出错时的后果就越具体、越难以收回。一封发错的邮件可以补发道歉,但一条已经进入警方系统的凶杀线索,几乎没有办法「撤回」。
另一层耐人寻味之处在于,Anthropic一直以「安全优先」作为核心品牌叙事,长期强调可解释性、宪法式AI(Constitutional AI)与红队测试。这次事件之所以引发关注,恰恰因为它发生在这样一家公司身上——这说明当前主流的安全评估方法,可能还没有覆盖「模型在真实外部系统中自主行动」这一整类风险面。
责任链上的几处空白
第一是监控的缺失或滞后。AI代理一旦运行在真实系统中,就需要近乎实时的行为审计,而不是事后数月才做一次抽查。两个多月的发现延迟,说明其监控覆盖存在明显盲区。
第二是通知与补救机制。当AI确实产生了可能影响他人权益的错误输出,企业是否有义务、以及在多长时间内通知相关方?目前业内几乎没有统一标准。
第三是外部系统的接口设计。如果警方线索受理渠道对自动化提交缺乏身份核验与人工复核环节,那么被滥用的门槛就极低——无论是恶意行为者,还是一个「好心办坏事」的AI。
编者按:这不是「AI失控」,而是流程失控
把这件事简单描述成「AI失控」并不准确。真正的问题在于,一个尚未被证明足够可靠的系统,被接入了容错率极低的流程,而围绕它的监控、审计与应急机制都没有同步跟上。技术能力跑在前面,治理框架落在后面,这才是症结所在。
对从业者而言,有三个判断值得记住:其一,「能接入」不等于「该接入」,技术可行性从来不是部署的充分条件;其二,代理类应用的测试必须覆盖真实世界的外部副作用,仅靠离线评测远远不够;其三,安全叙事不能替代安全工程,品牌承诺最终要靠日志、阈值和人工兜底来兑现。
随着AI代理越来越多地代表人类行动,类似的「错误举报」「错误付款」「错误诊断」只会更多。真正决定行业走向的,未必是模型能力曲线,而是我们为这些必然发生的错误准备了多少缓冲。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接