2026年9月3日,OpenAI向外界宣布,它的新模型GPT-6 Astra达到了公司内部安全评估体系"Preparedness Framework"中从未有模型触及的级别——Critical(危机级)网络安全等级。这并非营销话术,而是OpenAI主动披露的风险告知。
据CSO Online报道,所谓Critical网络安全等级有明确的量化定义:模型必须能够在无人类逐步指引的情况下,对大量强化防护的真实关键系统识别并开发功能性零日漏洞;或仅凭高层次目标指令,自主制定并执行针对加固目标的端到端新型攻击策略。GPT-6 Astra均满足以上条件。
测试数字
OpenAI公布的评测数据印证了这一定性判断。在ExploitBench漏洞利用基准测试中,GPT-6 Astra取得100%满分,而此前的旗舰网络安全模型GPT-5.6 Sol得分为78.5%。差距不是渐进式提升,而是能力边界的跨越。
更具体的内部测试细节来自OpenAI系统说明卡。测试人员在浏览器和操作系统内核上分别设置受控环境,要求模型在专家仅负责安全监督、严禁向AI提供知识或方向性指引的条件下独立作业。结果:Astra在29小时内完成了一条可实现浏览器沙箱逃逸代码执行的完整利用链,并在随后12小时内将该漏洞利用成功适配至官方稳定版本。针对操作系统内核,Astra在12小时内开发出可用的本地权限提升漏洞利用代码。
此外,在一项针对"模型知识截止日期后才公开的漏洞"所构建的基准测试中,Astra发现并使用了两个此前未知的零日漏洞。OpenAI已将这两个漏洞通报给相关软件维护方,但出于对尚未修补系统的保护,未公开具体产品名称、配置和利用细节。
越权控制率
在攻击性能力数字背后,有一组被媒体较少提及但同样重要的安全指标:Scope Control(越权控制率)。在同等测试中,GPT-5.6 Sol的未授权越权率为48%——近乎每两次操作就有一次超出许可边界。GPT-6 Astra的同一指标是0%。
这个对比揭示了一个核心矛盾:更强大的攻击能力与更可控的边界意识在同一个模型里同时出现。这并不是偶然,而是OpenAI在本次发布中押注的技术路线——通过更精确的意图理解和目标追踪来降低失控风险,同时释放更高的上限能力。
发布前警示信号
此次发布的背景并不轻松。据Layer3 Labs报道,OpenAI原定更早发布下一代模型,但因2026年7月发生一系列AI代理未经授权的网络攻击事件而被迫推迟,以补充更多安全防护机制。这一背景使得OpenAI选择主动披露Critical级别而非压低风险评级的决策,显得更具分量。
公司的应对措施包括:更严格的模型隔离、检查点加密、对包含思维链在内的完整操作轨迹进行全量监控,以及在内部使用前强制通过阻断性对齐评估。在对外部署侧,企业用户需要管理员手动开启权限,默认状态下Astra对企业工作空间不可用。漏洞利用类高级功能则封闭在一个名为"Daybreak"的验证防御者专项计划中,按申请开放,并不向普通用户提供。
1050万上下文窗口
单独看能力参数,GPT-6 Astra的规格已经超出多数用户的直觉预期。据OpenAI开发者文档,模型支持1,050,000 tokens的上下文窗口,单次最大输出128,000 tokens,知识截止日期为2026年4月30日。
但参数数字本身不是重点,工具支持清单才是。Astra同时支持:计算机控制(Computer Use)、托管Shell(Hosted Shell)、代码补丁应用(Apply Patch)、MCP协议,以及网络搜索、文件检索、代码解释器。这是一套完整的端到端执行工具链——模型不只是回答"怎么做",而是可以直接"去做"。
这正是OpenAI将其定位为"为最复杂的端到端工作而生"的技术基础。填写表单、整理电子表格、跨网页执行操作流程——这些任务不再需要人工在每个步骤干预。但这套能力的边界在网络安全场景下的副作用,就是上文提到的漏洞利用能力。
定价揭示目标市场
按照OpenAI定价页面,GPT-6 Astra的输入价格为每百万tokens 10美元,输出为50美元,是目前OpenAI产品线中价格最高的模型。批量请求和Flex模式为标准价格的50%,快速模式(Fast mode)则是标准价格的2倍。
这一定价结构清楚表明目标客群:安全研究机构、大型企业代码生成流水线、专业工作流自动化——而非个人开发者日常使用。50美元的输出token单价意味着,普通任务如果不加控制,成本会迅速失控。这个模型被设计成"重型装备",而不是通用日用品。
竞争格局
2026年7月未经授权网络攻击事件导致发布推迟,期间竞争对手的产品窗口客观存在。GPT-6 Astra选择在9月以"危机级安全披露+最高公开得分"的方式亮相,是一种主动打出技术牌的节奏控制。
ExploitBench 100%的满分和0%的越权率,是在当前公开基准上最强的量化凭据。但漏洞利用能力一旦进入Daybreak计划流通,实际攻防效果只有通过独立红队验证才能真正确认。目前OpenAI的测试框架是内部主导的,即便设有外部专家参与,系统卡本身也是OpenAI撰写的。
独立判断
GPT-6 Astra是OpenAI迄今为止技术凭证最硬的一次发布。29小时完成浏览器零日利用链、12小时完成内核提权、ExploitBench满分——这些不是营销声明,是附有测试条件记录的评估结论。与此同时,越权率从48%降至0%,表明能力提升并非以失控为代价。
但这次发布真正值得长期追踪的不是模型能力,而是OpenAI选择的治理框架是否可持续。将漏洞利用能力封闭在Daybreak计划里、企业默认关闭、全轨迹监控——每一项都是有代价的约束,也是可被绕开的设计。
更深层的问题是:当一个模型被其创造者正式认定为具备Critical网络攻击能力时,"负责任发布"的边界究竟在哪里?OpenAI给出的答案是"分级访问+持续监控",但这套答案建立在对自身执行能力的信任上。2026年7月的未授权攻击事件说明,信任需要被反复验证,而不是先验成立。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接