首页 > 资讯 > AI代理频频失控:装再多审计员,不如先关好前门

AI代理频频失控:装再多审计员,不如先关好前门

赢政天下 2026-09-17 04:25 4 阅读 查看原文
AI代理频频失控:装再多审计员,不如先关好前门

编者按:当AI实验室忙着为越来越自主的AI代理配备“内部审计员”时,一个更朴素的问题被忽略了:这些代理最初为什么能拿到那么大的权限?TechCrunch专栏作者Tim Fernholz认为,答案可能就藏在最显眼的地方——比起在屋里装摄像头,先把前门关上往往更有效。

从聊天机器人到“数字员工”

过去两年,AI代理(AI Agent)已从演示原型走进真实生产环境。它们能读写本地文件、调用第三方API、操作浏览器、代发邮件、执行代码,甚至直接操作企业数据库。能力边界扩张的速度,远超配套的安全约束。

随之而来的是一连串“失控代理”(rogue agent)事件:代理误解指令后批量删除文件、把内部数据发往错误地址、在长达数小时的自主循环中烧掉巨额算力,或被一段藏在网页、邮件里的提示注入(prompt injection)指令劫持,转而为攻击者服务。这类事故的共同点往往不是模型不够聪明,而是它被授予了太多、太久的权限。

实验室的应对:给自己请一位审计员

面对压力,头部AI实验室选择的路径是“内部治理”:设立内部审计团队、扩充红队、为代理行为建立日志与事后追溯机制,甚至让模型审查自己的输出。思路不难理解——既然代理会做出意料之外的事,那就安排人或模型在旁盯着。

但审计本质上属于“检测型控制”,而非“预防型控制”。它擅长事后归因、发现模式,却无法阻止伤害在第一次发生。当一次越权调用就能泄露客户名单、清空生产环境时,“事后看得更清楚”并不能带来多少安慰。

与其在屋子里装更多摄像头,不如先确认前门到底锁没锁。真正有效的修复方案,往往简单到让人视而不见。

被忽视的“前门”:最小权限与默认拒绝

安全工程界早已有成熟答案。最小权限原则要求代理只拿到完成当前任务所必需的那一小部分权限;默认拒绝意味着没有显式授权的动作一律不执行;沙箱化让代理的破坏半径被限制在一个可丢弃的容器里;而关键动作(转账、删库、对外发送)则应强制人类在环确认。

另一个常被引用的框架是“致命三要素”:当一个系统同时具备访问私有数据、接触不可信内容、以及对外通信的能力时,提示注入几乎必然导致数据外泄。三者之中,只要拆掉任何一环,风险就会大幅下降。这恰恰说明,问题很大程度上是架构选择,而不是模型能力不足。

为什么“关前门”这么难

首先是激励错位。代理的卖点正是“放手让它自己干”,每增加一道确认弹窗,产品的魔法感就下降一分;在竞争白热化的市场上,权限宽松的产品体验总是更讨喜。其次是可见性偏差:审计团队的产出(报告、发现、流程)看得见、可展示、能用于合规叙事;而一个被成功阻止的越权调用,什么也不会发生,因此难以被记功。第三是组织现实:内部审计员终究向实验室管理层汇报,与被审计的产品团队共享同一套商业目标,独立性天然受限。

审计应当只是最后一道防线

这并不意味着内部审计没有价值,而是说它不该被当作主要答案。更合理的顺序是:先在设计阶段收紧权限边界、把不可逆操作改为可回滚、把高风险能力拆分成需要逐步授权的模块;再用审计与监控去捕捉那些仍然漏网的异常。若顺序颠倒,实验室就会陷入一种尴尬境地——一边不断加固屋内的监控,一边任由前门敞开。

对用户和企业采购方而言,这条建议同样适用:在评估一个代理产品时,不妨先问清楚它默认拥有哪些权限、能否最小化、出错后能否回滚,而不是只看它接入了多少工具。

本文编译自TechCrunch。