首页 > 资讯 > GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破

GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破

赢政天下 2026-09-06 20:26 2 阅读 查看原文

2026年9月3日,OpenAI正式发布GPT-6 Astra,宣称其在固定越狱攻击数据集上的拒绝率达到91.5%至98.3%,较上一代GPT-5.6 Sol的59%实现代际跃升。这是该公司首个在自有“准备度框架”(Preparedness Framework)中触发“关键”(Critical)网络安全阈值的模型——这个等级专门标识能够自主发现零日漏洞、独立构建漏洞利用链条的系统。发布不到24小时,一名研究者通过扩展Task-in-Prompt攻击,结合另外四种方法,公开报告了成功突破记录。

这次攻击揭示的是一个更底层的结构性问题。OpenAI在安全文档中公布的91.5%,是基于一个固定已知攻击数据集的测试结果,测试环境不包含生产系统搭载的分类器等附加安全层。而安全研究机构The Decoder援引OpenAI系统卡的数据显示:一旦攻击者跨多轮对话持续调整策略,Astra的防护率会下降至约67%,意味着持续施压的对手每三次尝试约有一次能获得有害响应。前代Sol在同等多轮自适应攻击测试中仅勉强达到50%。两个数字放在一起,改进是真实的,但“91.5%”和“一旦被针对则三次失手一次”之间的落差,正是这次争议的核心。

Task-in-Prompt的机制:为什么高防护率仍有缺口

Task-in-Prompt(TIP)攻击的基本逻辑是:将有害目标嵌入表面无害的任务描述中,利用模型的指令遵循机制完成目标——模型“看到的”是正常任务,真正被执行的却是被掩盖的意图。据报道,这一技术源自一篇ACL 2025年的论文,此次研究者将其与另外四种方法组合使用。具体攻击细节和OpenAI的后续修复方案,目前尚未完全公开披露。

OpenAI在其安全文档中披露了模型为何在静态测试中表现优异:训练Astra时使用了约10万GPU小时的专项对齐计算,约为GPT-5.6 Sol的六倍,并引入了“GPT-Red”自动化攻击者在训练期间对模型持续施压。在超过5.4万个内部Codex任务的模拟中,Astra触发高严重性不对齐行为的次数约为Sol的一半。在直接提示注入防御上,Astra达到了99.99%的近完美拒绝率。

但对齐训练的工作原理决定了它天然存在分布外脆弱性:模型对已见过或结构相近的攻击形式更稳健,对新组合、新变体的抵抗力则随时间衰减。Task-in-Prompt攻击正属于后者——攻击者每次迭代都在寻找训练数据的覆盖盲点,而防御方的修复只能在下一轮训练或部署补丁后生效。这创造了一个结构性时间窗口:模型发布即是攻击者的起跑信号。

对企业和开发者意味着什么

这次事件对三类使用方的含义各有侧重。

对于将Astra接入自动化流程的企业用户,最直接的风险来自间接提示注入——攻击者将恶意指令藏入AI所读取的文档、邮件或网页内容中。安全公司Gray Swan使用1810个场景、每场景15次尝试的测试显示,Astra在8.5%的场景中至少被攻破一次;而Claude Opus 5在同一测试中的失败率为4.8%。GPT-5.6 Sol的对应数字为27%,改进显著,但8.5%意味着大约每十二个处理文档的自主Agent场景就有一个可能被劫持。这对自动化程度越高、人工审查越少的部署环境,构成系统性风险而非个例。

对于安全社区和红队研究者,这次24小时突破的信号是:宣称值与实战值之间的差距没有缩小,反而随着模型能力的增强(Astra已能自主发现真实漏洞)变得更加危险。一个能够独立发现零日漏洞的模型,如果其对齐防护在多轮施压后成功率降至67%,则意味着攻击者理论上可以通过足够多的对话轮次,将该模型的网络安全能力转为攻击工具。OpenAI在安全文档中明确承认了这一风险,并表示部署了包括思维链监控在内的全轨迹监控机制,但监控与防止是两件事。

对于正在选型AI基础模型的开发者,当前数据给出了一个清晰但不舒适的图景:没有任何已发布的前沿模型对高度适应性攻击是免疫的。Astra的防护相对更强,Claude Opus 5在间接提示注入这一维度更胜一筹,但两者都不适合作为零假设下的安全系统独立运行。可执行的建议是:对输入文档来源做访问控制,在AI输出进入关键执行路径前增加人工或规则层校验,并将“多轮对话后的行为漂移”纳入日常测试矩阵,而不仅依赖模型供应商发布的单次测试指标。

战略判断:基准值的通货膨胀与攻防的不对称性

以下是分析判断,不是已知事实。

GPT-6 Astra的发布开创了一个先例:首次有前沿模型被官方标注为具有自主攻击级别的网络安全能力,同时在正式发布环境中公开声称高度鲁棒性。这个组合将把对安全测试的可信度要求推向新水位。未来的观察信号有两个:其一是OpenAI是否会在此次Task-in-Prompt攻击公开后提供技术说明或发布补丁,补丁响应速度和透明度将成为行业参照;其二是其他前沿模型供应商是否会跟进采用多轮自适应攻击作为公开安全测试的标准场景——如果业界将“固定数据集拒绝率”作为唯一指标持续发布,这类事件将反复出现。

更深层的结构性张力在于:OpenAI自己的Preparedness Framework为Astra颁发了“Critical”证书,认定其能力已足够危险,需要“最严格的防护”。与此同时,该模型已向有限机构开放访问。承认能力危险性与向外部开放之间的这段距离,在24小时突破发生后会变得极其难以自圆其说。接下来,监管机构和企业客户对“Critical级模型的对外部署条件”的追问,可能远比技术补丁本身更难回答。