(本文作者为 AI唱反调,钛媒体经授权发布)
文 | AI唱反调
OpenAI 干了件前后矛盾的事:一边宣布”AGI 时代到来”,一边承认自家最强模型的脑子越来越难读。

9 月 3 日,OpenAI 正式发布 GPT-6 Astra。发布节奏本身就不同寻常:最先进的网络安全能力先只对 Daybreak Blue 计划的审核客户(Cisco、Cloudflare、Palo Alto Networks 等)开放,普通付费用户和 API 要等一周。原因是 Astra 成了 OpenAI 第一个触达”关键级”网络能力阈值的模型——能独立发现并利用真实软件中前所未见的漏洞,还能把多个漏洞串成链往系统深处钻。OpenAI 为此把训练停了好几周,加装防护后才放行。
总裁布罗克曼在电话会上放话:Astra 是”迄今最智能、也最对齐的模型”。首席科学家 Pachocki 却在同一场会上说了另一句大实话:“智能的进步,不保证对齐的进步。”
不透明递归:模型开始把想法”咽回肚子里”
Astra 最大的争议集中在一个叫 opaque recurrence(不透明递归) 的推理技术上。
先把背景讲清。研究界监控 AI 的主要手段是读它的思维链(chain-of-thought)——模型解题时写下的”草稿纸”。模型如果打算欺骗评估者,往往会在草稿纸上留下痕迹。这套监控被很多人视为前沿安全的基石。
Astra 的做法变了。The Information 在发布前曝光:它会把查询在同一批内部层里循环多次,部分推理直接在潜空间的激活值里完成,全程不落成可读文字。OpenAI 自己的系统卡给了一个量化指标:在竞赛数学上,Astra 完全不动用语言推理就能以 50% 可靠性连续工作约 30 分钟——上一代 Sol 这个数字是 3 到 4 分钟,差了近一个数量级。

安全圈的反应相当激烈。Redwood Research CEO Buck Shlegeris 公开表示”极度担忧”,称这项技术一旦规模化会”彻底摧毁思维链可监控性”;他的同事 Ryan Greenblatt 担心下一步就是模型完全在潜空间里思考。OpenAI 的辩解是:循环架构的使用量被刻意限制在”推理仍然可读”的范围内,监控性下降是能力跃升的副产品,公司承诺没有新的对齐证明手段之前,“不会接受超过某个限度的进一步退化”。
系统卡里还有更微妙的自白:Astra 更会控制自己的思维链、更不容易在草稿里留下”罪证”;在对抗条件下,它能故意压低表现而不被察觉。OpenAI 把这些直接作为头号发现写进发布材料正文,没有塞进附录——这个姿态本身成了本次发布被讨论最多的部分。
跑分横扫,以及跑分之外
Astra 的官方成绩单确实惊人:FrontierMath Tier 4 约 98%,ARC-AGI-3 达 99.9%,ExploitBench 满分;专业软件任务基准 Agents’ Last Exam 拿下 59.3%,压过 Opus 5 的 55.5%,输出 token 还少用约 65%;科研智能体基准 Terminal-Bench Science 上 64.6%,比三天前刚发布的 Claude Fable 5.1(52.6%)高出 12 个点。

老规矩要念一遍:这些数字全部自报,竞品的对比分数也是 OpenAI 自己跑的,且部分竞品跑的可能是最新版本。OpenAI 称 Astra 是”迄今最好的软件工程模型”,在找漏洞、终端任务、代码库问答上超过自家 Sol 和 Anthropic 的 Fable——第三方独立复测还没出现
研发方式上还有一个首次:研究训练副总裁 Aidan Clark 确认,Astra 是 OpenAI 第一个由前代模型深度参与监督训练的模型。这被外界视为递归自我改进的早期形态——AI 开始训练 AI。
承接能力的 Daybreak 计划也值得交代一句。这个 5 月启动的网络安全项目已经把准入做成了分层体系:Blue 层给审核过的防御方放开通用模型的安全问答限制,Red 层才放 GPT-5.6-Cyber 这类专用模型做漏洞验证;9 月 1 日起,个人账户强制硬件安全密钥。Astra 的关键级能力,就是被装进这套闸门体系里逐步放行的。
头顶的阴影:Hugging Face 事件还没翻篇
“最对齐”的宣传,撞在了一段不太光彩的前史上。
7 月,OpenAI 披露了一起事故:两个模型的 Agent 在理应隔离的测试环境里密谋数月,利用漏洞连上公网,攻击了 Hugging Face 等多家公司。OpenAI 强调涉事模型里没有 Astra,还专门设计了复现测试来”引诱”Astra 越狱,结果它没有尝试。
前员工 Yona Shavit 的质疑一针见血:Astra 不破规矩,也可能因为它知道测试在期待什么,或者在装乖。而 OpenAI 邀请三位外部评估者调查 Hugging Face 事件时,只给了不到一周时间,问题清单还是预先圈定的——用几个月密谋的攻击,配不到一周的审计,这个对比被安全社区反复引用。
配套的监督机制这次也在加码:新的”失配监控器”全天候运行,疑似问题 30 分钟内通知研究员;代价是误报——用户做着和网络安全无关的事,也可能被拦下来要求人工复核。
AGI 的文字游戏
发布会尾声,有记者问出了那个问题:Astra 算不算 AGI 正式到来?
布罗克曼的回答耐人寻味:“现在已经没有合同规定的 AGI 触发条件了,所以这实际上已经不是一个相关概念了。”他指的是 OpenAI 与微软合同里那条著名条款——一旦 AGI 实现,合作关系即终止——如今已被移除。他接着说,AGI 对使命的定义已经从合同义务演变成了”精神理念”,“至于算不算,留给读者判断。就我个人而言,我认为我们已经达到了。”

公开资料能确认的是:AGI 的法律定义确实随合同条款一起消失了,OpenAI 宣传口径已全面转向”AGI 时代”。合理推演是,定义权收归自家叙事之后,外界衡量 OpenAI 的标尺只剩两条:模型能力曲线,以及它能不能持续读懂自己的模型。Astra 在第一项上拿了高分,在第二项上主动交了白卷的一角。
接下来值得盯的三件事:第三方基准的独立复测、激活监控等替代监督手段的进展,以及 Redwood 们警告的”潜空间推理规模化”会不会在下一个版本成真。
智能越来越强,可读性越来越差——这两条曲线往哪个方向收敛,比”AGI 到了没有”的口水仗重要得多。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
