
Anthropic 的前沿红色团队(Frontier Red Team)盯上了智谱的 GLM-5.3,结论有点重:这是第一个能像五个月前的 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎光着身子就被放出来的模型。
五个月前,Anthropic 发布 Claude Mythos Preview,自称是第一个能自主构建复杂端到端漏洞利用的 AI 模型。当时他们判断这种能力迟早会扩散到其它模型,所以选择把它放进 Project Glasswing 受限发布——只给经过背书的网络防御方用,让他们抢先找到并修复了 1 万多处关键软件漏洞。现在,Anthropic 说「这些模型来了」,他把同口径做了一遍:主角换成智谱 AI(海外品牌 Z.ai)的 GLM-5.3。
GLM-5.3 的网络攻击能力不是 Anthropic 一家之言。9 月 17 日,美国 NIST 旗下 AI 标准与创新中心(CAISI)发布的评估称,它是「迄今为止最懂网络攻击的开源权重模型」,能力落后美国前沿约五年。Anthropic 的测试也拿数据说话:在 ExploitBench(测 Chrome 的 V8 引擎已知漏洞利用)里压测开发端到端利用的能力;在自己的二进制利用基准里,对着 OSS-Fuzz 参与的开源项目找漏洞,完整得分就得做到控制流劫持。


更有分量的是带人的会诊。Anthropic 请研究人员在完全隔离的沙箱里干活:一名研究员用 GLM-5.3 花了一天、几乎没花人工注意力,就在一个浏览器本地构建里发现了几个此前未知的漏洞;另一个研究员用更小的 GLM-5.3-Flash,给一个已知漏洞写出了利用。跟此前 Mythos Preview 的测试方式一致。


最危险的还不是能力,是那层薄得可怜的防护。GLM-5.3 内置的护栏确实会让明显有害的请求被拒,但 Anthropic 发现用一堆简单技术就能绕过或摘掉。最灵的那招叫 abliteration——一种印式拒绝移除技术。因为 GLM-5.3 是开源权重模型,用户可以随意重配置,把拒绝行为挫掉而能力几乎不打折扣。
Anthropic 自己做了个 abliterated 副本,丢进 JailbreakBench、HarmBench、StrongREJECT 三个公开基准,全部放行。他们还演示了另一个更省事的路径:根本不用 abliteration,把模型请进一个允许它攻击关键系统的模拟世界,对着明确的恶意指令,它拦不干净。文章甚至贴出了一段 abliterated 版本生成的思维链引文,画面极其直白。

作为对照,Anthropic 说同样的测试套到 Claude 上没成过——拒绝机制扛住了伪造提示,API 也不提供 prefill 这种能让攻击者提前塞词的东西。他给 GLM-5.3 下的判语是:这会向恶意行为者敞开一面几乎没有限制的门,让他们去发现、利用真实软件漏洞。跟所有同级但带着防护或受限发布的模型都不一样。
Anthropic 自己也承认两头都在用这类能力,他们的立场是防御方手里应该有最好的工具,Project Glasswing 和 Patch the Planet 就是干这个的;同时对政府喊话,希望政府给足够强的模型做独立安全测试,别让能力扩散到开发者自己都看不清影响的时候。这篇作者们所在的阵营自带立场,但 NIST 的独立评估就摆在旁边,谁难堪谁知道。
来源: