首页
>
资讯
>
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
每题狂烧 360 美元,GPT-6 真的通关 AGI 了?
作者丨高允毅
编辑丨岑 峰
OpenAI 的最强模型 GPT-6 Astra终于亮相,它在电脑操作、科研探究和安全防御上都有惊人的突破。而在众多亮眼成绩中,最引起大众热议的是它在 ARC-AGI-3 测试中,成绩逼近100%。
ARC-AGI-3 是什么?这是目前全球科技圈公认AI “智商”评测榜,你可以把它理解为 AI 界的门萨俱乐部入会考试。
这个测试里全是不断变化的图形规律题,根本没法刷题,AI必须像人类一样去探索环境、推测目标,靠临场反应和推理能力找出规律。这在各类评测中较为高阶,更能测试出 AI 到底只是一个工具,还是真智能。
而 GPT-6 Astra竟然把这个测试打穿了,要知道,上一个模型 GPT-5.6 Sol 的分数还是 38.3%,这实在是一个巨大的飞跃。这种智力甚至碾压人类,在96% 的关卡中,它都比人类的操作效率更高,平均动作步数比人类少 51.7%。
如果一个 AI 在完全陌生的环境下,真正具备了建立逻辑规律并解决问题的能力。我们可以畅想一下,未来,或许它可能在未知的自动驾驶路况中,做出正确的选择,或者在全新的未知病毒爆发时,迅速推演出特效药的分子结构。
为了探究 GPT-6 Astra为什么这么聪明,ARC Prize 官方亲自复盘了它的后台记录,发现它在玩游戏时,会生成高效的“符号世界模型”。
符号世界模型是“世界模型”的高级衍生品。当世界模型像艺术家一样,用画面来预测未来时;即时符号世界模型更像一个数学家,将现实世界抽象为逻辑符号和因果代码。
过去,很多大模型在 ARC-AGI 系列基准测试中拿不到高分一个重要原因,就是它们习惯了“暴力试错”。AI 会把游戏画面切成像素块,先随便点一下,不对就换个方向,靠运气通关。
这种模式下,就算有一些分数的突破,AI也不是真正理解和掌握游戏规则。
符号世界模型之所以能掌控全局,正在于它是对周围环境物理规律、因果关系充分理解后,通过精密计算后做出选择。
在实际测试中,当 GPT-6 Astra进入陌生的图形游戏后,它会开始用自创的 DSL ,一种专属的代数符号系统,对观察到的环境做大量笔记。比如,它会精准记录下游戏潜在的隐性规则、一连串即将执行的指令,甚至将每一个像素的运动轨迹都精确映射到坐标系上。
这种代数的记录方式带来的是唯一确定的世界状态,相较于之前模型用自然语言交互产生的歧义性,这种符号化表述会让准确率带来史诗级飞跃。
然后,它会先在脑海里写出一套 Python 代码逻辑:“如果我按 A,图形就会左转 90 度”。
接着,它会在自己大脑里建一个“虚拟沙盒”,在脑中模拟接下来的计划。确认逻辑闭环、准确无误后,它才会在现实游戏中点下第一步。这就是为什么,它的操作效率远高于人类的原因。
为了摸透 GPT-6 Astra能力边界,红队测试平台 PRO‑LONG 把它放进代码沙盒,允许 AI 自主编写、运行自定义代码。
结果,GPT-6 Astra 居然开始为每一款游戏“量身定制”工具。比如在一个有守卫巡逻的复杂迷宫游戏里,GPT-6 Astra自己写了个导航系统,接着又添加了战斗规则,还模拟了守卫的巡逻路线,最后通过这套自制工具链完美预测并校验了成果。
早些年,这套符号推演、自主造工具的能力,完全依赖外部 Harness 外挂框架实现。外挂帮模型做画面转译、状态记录、结果校验,但是缺点十分突出:模型和外挂来回传输数据带来高额延迟;外挂的工程能力与大模型本身的权重训练完全脱节;由于对云端计算环境和外部脚本的重度依赖,这类高阶能力很难被部署到端侧边缘硬件上。
而 GPT-6 Astra现在把大量属于 Harness 的能力,内化进模型自身权重。一直推崇符号世界模型的顶尖学者Gary Marcus忍不住盛赞 GPT-6 Astra是这一路线的重大胜利。
近一两年来,学术与产业界在这个方向涌现了大量核心成果,从哈佛、MIT 到 Google DeepMind,所有人都在押注“符号世界模型”。在通往 AGI 的无数条分叉路口前,业界正在达成某种底层的技术共识。
很有意思的是,在全网为这一刷榜分数沸腾时,不少人转发 OpenAI 总裁 Greg Brockman 那句“ AGI 已来”时,ARC Prize 基金会总裁 Greg Kamradt 亲自下场泼了冷水。
他是出题人中的核心人物,基准怎么设计、分数怎么解读,他最有发言权。从评测角度,他认为分数虽然是真的,但这玩意离 AGI 还差着十万八千里。
到目前为止,他已经看到了不少团队靠 Agent Harness 在ARC-AGI-3 上拿到 90% 以上,比如有超强记忆外挂的 PRO-LONG、擅长深度推演的 Tycho、能自我进化编程环境的 Prime Agent。
这些拿高分的产品都有共同的技术配方,即拥有无损内存、程序化分析、显式假设检验、持久状态、低成本内部计算五大部分。
其中无损内存负责记忆,程序化分析负责逻辑,显式假设检验负责推演,持久状态负责多轮交互的上下文,低成本内部计算负责廉价内部算力,让 AI 能在虚拟环境里疯狂试错后再输出正确答案。这些共同组成了一个无敌的 Harness,会补足模型自身的不足。
GPT-6 Astra逼近 100% 的成绩,同样用了一套豪华的 Harness 加持,它借助了专门定制的“供应商适配器基座”,利用连续对话和上下文压缩来帮它撑起逻辑链,每跑完一局游戏,就需要消耗 360 美元的昂贵算力。如果完整跑完一整场测试,总算力账单会高达惊人的 1.8 万美元(约合 13.5 万人民币)!
人类解一个图形谜题可能只需要几分钟,按人脑 20W 代谢功率折算电费,不到半美分;即使算上支付给受试者的真实时薪补贴,折合每局也就 12.78 美元,而 AI 要花掉 360 美元。这种靠“钞能力”拼出来的成绩,真的能成为普通人触手可及的 AGI 吗?
当然,GPT-6 Astra 已经开始把 Harness 的能力逐步内化,如果继续发展,模型内部的潜在计算能力会越来越厉害。不过,因为其推理过程开始不透明,开发者们也不知道,AI是真的懂了,还是找到了更高效的作弊途径。
回到上面的问题,GPT-6 Astra到底算不算 AGI ?
对于这个问题,Greg Kamradt 在他的长文最后,给出了一个充满哲思的回应。人类为什么能被视为“通用智能”,因为人类可以适应任何未知的世界,哪怕是把古代的婴儿扔到现代,他同样能学会坐地铁、用手机。这种智能延续千年,不断推进科技进步。但现在科技界要氪金通过的测评,只是给 AI 办的一场“图形消消乐考试”。
这只是证明 AI 正在变聪明,但绝不是 AGI 到来的证据。
https://arcprize.org/blog/astra https://x.com/gregkamradt/status/2095600045873828013?s=46
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。