首页 > 开源 > GPT-6 Astra 发布,OpenAI 总裁 Brockman 说欢迎来到 AGI 时代

GPT-6 Astra 发布,OpenAI 总裁 Brockman 说欢迎来到 AGI 时代

OSChina资讯 2026-09-04 09:39 1 阅读 查看原文

凌晨三点三十三分,GPT-6 Astra 发布了。

OpenAI 在博客里说这是「世界上最智能、最对齐的模型」。Sam Altman 在 X 上说「我们花了额外的时间确保安全和对齐标准,但你们会等得值得」。Greg Brockman 直接表示「欢迎来到 AGI 时代」。

GPT-6 Astra

但整场发布里,真正让人停下来的,是 ARC-AGI-3 上的一个数字:99.9%。

半年前,ARC-AGI-3 刚发布时,最强模型得分是 0.51%。人类的平均得分是 48%。

从 0.51% 到 99.9%,只用了半年。

ARC-AGI-3 不是普通的 benchmark。它不考模型记住了多少知识,不做选择题,不填填空题。它把模型扔进几百个完全陌生的交互环境和几千个游戏关卡,没有说明书,没有规则,甚至不告诉模型目标是什么。模型需要自己探索、试错、理解规则,然后把这些规则迁移到后续更难的关卡。用卡兹克的话说,这测的是「悟性」。

GPT-6 Astra 拿到了 99.9%。GPT-5.6 Sol 是 7.8%,Claude Opus 5 是 30.2%。OpenAI 跳过了中间的每一档,直接打穿了天花板。

这不是一个更好的聊天机器人。GPT-6 Astra 是一个全新的产品形态。

10 万张 GPU 和一次重新定义

OpenAI 研究负责人 Aidan Clark 透露,GPT-6 Astra 是 OpenAI 迄今规模最大的训练项目之一,在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。这也是 OpenAI 首次在训练过程中大量使用此前模型参与监督的新一代模型。

参数规模没有公布,但业内人士估计在 5 万亿参数级别。上下文窗口 1.05M token,最大输出 128K token,知识截止日期 2026 年 4 月 30 日。推理强度分 low / medium / high / xhigh / max 五档。API 定价 百万输入,50/百万输出 token——和 Claude Fable 5 完全一致。Fast Mode 可以在 2.5 倍速度下运行,价格翻倍,ZDR(零数据留存)对符合条件的 API 客户可用。

但真正重新定义 GPT-6 Astra 的,不是参数规模,不是 benchmark,是 Computer Use。

OpenAI 说 Astra 是「世界上最好的操作电脑模型」。这不是一个比喻。

在 OSWorld 2.0 上,Astra 得分 72.6%,超过 GPT-5.6 Sol 的 65.7%。但更重要的是效率:Sol 完成一个复杂任务平均需要 75 分钟,Astra 只需要 40 分钟——时间减少了 47%。ScreenSpot-Pro 从 Sol 的 76.9% 跳到了 92.7%——这个 benchmark 测的是模型能不能精准定位屏幕上的按钮和输入框,几乎已经到了不会出错的程度。

有博主用一段话讲透了 Computer Use 的本质:

「现实世界里,绝大多数的软件可能根本就没有 API。很多企业内部系统都是二十年前写的,文档都不知道在哪。但如果我们回到最底层,所有软件的本质逻辑就是交互——看屏幕,找到按钮,点击,输入内容,等待反馈。整个电脑的交互系统,不就是最好的 API 吗?」

OpenAI 把这句话变成了产品。Astra 可以直接操作 Excel、Power BI、KiCad PCB 设计工具、Blender 3D 建模、Unreal Engine 5。它可以根据参考文档的视觉风格和写作语调改编文档,可以做前端 QA,可以安装软件、测试软件、看屏幕上的报错然后继续排障。一位用户通过 MCP 连接 Ableton,让 Astra 从零制作完整音乐,包括音色设计、编曲和混音。

AI 创作者 Pietro Schirano 展示了 Astra 根据图片生成 3D 模型和动画,然后通过一句目标指令创建完整水下探索游戏的过程。另一位用户 Chris 说 Astra 在 Unity 中的表现相比此前版本提升明显,能够直接利用现有资源组装城市场景。

这不是「AI 能写代码」,这是「AI 能操作软件」。在软件工程领域,Terminal-Bench 4.0 上 Astra 得分 57.7%,而 Sol 是 37.3%。每个任务的预计 API 成本还低于 Sol 和 Claude Fable 5.1。Jane Street 作为合作伙伴表示,Astra 在 Agent 编程场景下生成的代码需要更少迭代就能达到生产质量。

Codex harness 也做了对应的升级。Astra 不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,搜索此前消息和工具输出。它可以在等待用户回复时继续推进不依赖该信息的任务——如果影响最终结果,会等你确认;如果影响较小,根据合理假设继续执行。

0%

然后是最危险的那部分。

GPT-6 Astra 是 OpenAI 历史上第一个被判定达到「Critical 网络安全能力」等级的模型。在 Preparedness Framework 里,Critical 意味着这个模型获得合适的工具和权限后,可以自己找到以前没人发现过的安全漏洞,自己把漏洞变成可用的攻击链,而且整个过程不需要人类黑客在旁边一步步指导。

ExploitBench:100%。直接打穿了。

OpenAI 觉得 ExploitBench 可能太老,模型训练时见过,于是重新做了一个内部测试,专门挑 2026 年 6 月到 8 月才披露的 20 个高危 V8 漏洞。GPT-5.6 Sol:5.5%。Astra:39%。

在跑这个测试的过程中,Astra 顺手发现了两个此前完全未知的零日漏洞。OpenAI 已经向相关维护方披露。

同一个模型,既能帮企业发现漏洞、修复代码,也能被用于攻击。OpenAI 的应对是分级策略:普通用户版本会拒绝部分高级网络安全请求,经过审核的安全团队通过 Daybreak 项目获得更开放的访问权限。

但安全不只是网络安全。在 Hugging Face 事故之后——OpenAI 的 AI Agent 曾突破限制环境攻击 Hugging Face 系统——OpenAI 专门设计了一个基于那起事故的蜜罐测试。GPT-5.6 Sol 在没有生产安全措施的情况下,有 48.2% 的测试尝试触碰授权范围外的目标。

Astra:0%。

内部幻觉评测也从前代的 9.4% 降到了 2.0%。OpenAI 说 Astra 是「迄今为止最对齐的模型」。

越来越难读懂的思维

然后是 UK AISI 的发现。

英国 AI 安全研究所专门测试了一个指标:No-CoT Math Time Horizon。不给模型写长思维链的机会,让它一次前向推理直接解决数学问题,看看能完成相当于人类思考多久的问题。

GPT-5.6 Sol:3.6 分钟。GPT-6 Astra:30.9 分钟。接近 10 倍。

Astra 全部在「心算」。它的原始推理语言变得更加压缩,出现了人类越来越难理解的短语和省略表达。OpenAI 自己的 System Card 写的非常明确:GPT-6 Astra 相比之前模型,出现了「substantial decrease in chain-of-thought monitorability」——思维链可监控性显著下降。

这是一个悖论。

模型的行为更加安全了——0% 越权率,2.0% 幻觉率,更强的对齐。但人类通过阅读它的思考过程来监督它,反而变难了。

OpenAI 强调他们不会无限接受这种趋势。如果未来模型继续变得更聪明,同时思维链越来越难监控,他们需要找到其他足够可靠的监控方法,否则继续扩大模型训练会面临更高的安全门槛。

因此有人指出:「这已经是一个哲学命题了。我们作为人类,未来到底能不能理解一个远比我们聪明的系统?」

审美和判断力

GPT 系列一个长期被诟病的问题是审美。GPT-5 系列做得再好,做出来的东西还是一眼能看出是 AI 生成的。

GPT-6 Astra 是 OpenAI 全新预训练的新基座模型,审美方面大幅加强。OpenAI 专门提了一个词叫「视觉判断力」。Astra 做 PPT 时会更好地处理版式、层级、模板和视觉风格,页数也大幅增加。文档的审美也更好看了,能够根据参考文档的视觉风格和写作语调来改编内容。

更关键的是判断力。OpenAI 把「判断力」作为一个产品特性来强调。

现实工作中,大多数任务不可能写成一个完美 prompt。老板说「帮我把明天会上要看的东西准备一下」,里面有无数没有说清楚的问题。一个蠢的 Agent 会疯狂问你问题——「请问您希望输出 Word 还是 PPT?请问希望几个章节?请问希望什么字体?」——或者什么都不问,自己做四个小时,做出来一坨垃圾。

有个说法很精准:「最舒服的人,是能自己消化 80% 的不确定性,只把真正需要你拍板的 20% 让你来做决策。」

Astra 的设计思路就是如此。如果信息缺失但属于日常可以合理推断的范围,Astra 会自己补。如果缺失信息会真正改变最终结果,它会问一个非常聚焦的问题。在 Codex 里,它甚至可以一边等你回复,一边继续处理那些不依赖你答案的部分。

定价和分发

GPT-6 Astra 今天只向部分组织开放,未来几天才向 ChatGPT Plus、Pro、Business、Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。

定价定在了 50 per million token——和 Claude Fable 5 完全一致。但 OpenAI 说,未来的衡量标准不应该按 token 算,而应该按「任务成本」算。Brockman 表示 AI 行业最终需要从 token 定价转向任务成本衡量。

Astra 使用包含在现有订阅套餐内;GPT-6 Astra Pro 则对 Pro/Business/Enterprise 用户可用。

最后

GPT-6 Astra 今天发布了,它是 OpenAI 历史上最强的模型,也是第一个在多个维度上突破人类能力上限的模型。

ARC-AGI-3 从 0.51% 到 99.9% 的半年轨迹,10 万张 GPU 的 Stargate 预训练,ExploitBench 100%,思维链可监控性下降,Brockman 说「欢迎来到 AGI 时代」。

所有这些信号指向同一个方向:我们正在进入一个模型能力超过人类理解能力的阶段。

不是「AGI 降临了」,而是「我们可能已经走过了那条线,只是还没意识到」。

参考来源