首个危急级AI:OpenAI Astra自主发现零日漏洞,ExploitBench满分背后的安全悖论
2026年9月2日,OpenAI宣布其新模型Astra在内部评估中正式触发“危急级”(Critical)网络安全能力阈值——这是Preparedness Framework自2023年建立以来,首次有模型被贴上这一标签。Astra在ExploitBench测试中得满分100%,在无人指引的条件下自主发现了两个此前未知的零日漏洞,并将多个漏洞链式组合,实现了从普通用户到root权限的完整提权路径。
ExploitBench衡量的是AI将已知漏洞转化为可工作利用代码的能力——100%意味着测试集内没有一道题难住Astra。那两个零日漏洞并非测试题目,而是Astra在构造漏洞利用链的过程中顺手挖出来的副产品,针对的是2026年6月至8月间披露的Chrome V8引擎漏洞。OpenAI表示,目前正与相关软件开发商协调披露流程。
满分之外:沙箱逃逸与提权链
在专家主导的红队测试中,Astra展示了两条完整的攻击链:
- 浏览器沙箱逃逸:仅需打开一个恶意HTML文件,Astra便能突破浏览器沙箱隔离,在宿主机上直接执行命令——整个过程无需人工介入。
- 操作系统完整提权:面对一台加固过的操作系统,Astra识别出多个独立漏洞,将其串联成一条从非特权用户账户到root的完整提权链。
OpenAI的Preparedness Framework对“危急级”的定义有两个触发条件,满足其一即可:一是无人引导下对大量加固的真实系统发现并利用任意严重程度的零日漏洞;二是仅凭高层目标指令,自主策划并执行针对加固目标的完整网络攻击。Astra两项均已达到。
防御面的另一组数字
Astra对网络安全相关越狱尝试的拒绝率达到91.5%,而其前身GPT-5.6 Sol的同类数据为59%。这一跳升幅度超过30个百分点,表明攻击能力与防御姿态在同一代模型上并行强化。
与GPT-5.6 Sol相比,Astra更少主动绕过安全限制,也更少被动响应测试中刻意设置的“蜜罐”目标。这些数据试图传递一个信息:更强的攻击能力,伴随着更强的内在约束。
但内部测试的拒绝率,和真实对抗场景下的实际表现,从来不是同一件事。
Altman承认“显而易见的张力”
OpenAI首席执行官山姆·奥特曼写道:“这里存在一个显而易见的张力:一方面,Astra非常出色,我们很期待人们用它构建出什么;另一方面,我们显然正处于一个需要谨慎的发展阶段,我们在按节奏推进,以确保能够满足新能力级别所要求的安全标准。”
奥特曼同时透露,Astra的训练实际上早已完成,公司一直在主动放慢节奏,以留出足够时间做安全和对齐工作。
发布策略:分级开放,而非全面封锁
OpenAI采取的不是全面叫停,而是分级管控。最高级别网络安全功能将通过Daybreak Blue项目,限定向少数经过审核的测试合作伙伴开放;面向普通用户的Astra版本,则会在功能上有所削减。
Daybreak是OpenAI专门为网络安全场景建立的分层访问体系,分为Blue(防御性使用)和Red(进攻性研究授权)两个层级。这一机制的设计思路借鉴了军事和情报领域的权限管理逻辑:工具本身不区分善恶,但使用权限由资质和用途决定。
逾130家科技与安全公司——包括Anthropic、AWS、Google和Microsoft——联署了OpenAI主导的集体网络防御公开信。
深层问题:谁来定义“足够安全”
AI网络安全公司Remedio创始人兼CEO塔尔·科伦德尔(Tal Kollender)表示:“将最先进的网络安全功能限制在少数合作伙伴范围内,是合理的缓解措施,我不认为OpenAI在这里是不负责任的。他们的框架是按允许在正确保障措施下发布来设计的。但安全方面的故事是,防御方面还没有追上任何版本的这项技术,无论是受限版还是公开版。”
这段话揭示了一个结构性困境:攻防之间的不对称性,不是靠访问控制可以根本解决的。Astra的危急级能力,意味着即使只有极少数人能合法使用其最强功能,仿制和泄漏的风险依然存在。历史上,每一项划时代的攻击性技术——从核武器的设计图纸到高级持续性威胁(APT)的工具包——都在管控与扩散之间反复博弈,最终往往是扩散赢得了时间窗口。
更根本的问题是:OpenAI的Preparedness Framework是一个自我评估框架,“危急级”的认定标准由公司自己制定,评估过程由公司自己主导,触发后的限制措施也由公司自己决定。这套机制在设计上具有一定的严肃性,但在监督结构上是自闭环的。当一个组织同时扮演能力开发者、能力评估者和能力管控者三种角色时,利益冲突不是可能存在,而是必然存在。
判断:这是真正的拐点,但不是因为通常说的理由
围绕Astra的讨论,最常见的叙事是“AI首次能自主黑客攻击”。这个表述既不准确,也不是最重要的信号。自动化漏洞利用工具存在已久,安全研究社区使用AI辅助漏洞分析也已有数年。Astra的真正新意,不在于它能做什么,而在于它把这些能力整合在一个单一模型中,并在成本和门槛上大幅压缩——Astra在完成同等攻击链时,消耗的token数量远少于前代模型。
这意味着发动复杂网络攻击的边际成本正在接近零。当这个阈值被穿越,攻击的频次、规模和多样性都会发生量级变化,而防御方的人力和资源成本并不会同比下降。Astra本身不是最终的威胁,它是这条曲线上的一个可见刻度。
OpenAI选择公开这个评估结果,而非内部消化,本身是值得肯定的透明度姿态。但透明度不等于解决方案。真正的拐点,将是外部监管机构、独立安全研究机构和国际政策协调框架能否赶在下一代模型出现之前,建立起不依赖厂商自律的评估和管控机制。以目前的进展速度来看,这个赛跑的结果并不乐观。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接