Sebastian Raschka 试完 GPT-6 Astra 之后,给了一个在他嘴里算很高的评价:「可能是我用过的最好的模型」。
但这篇长文真正的重心不在夸 Astra 有多强,而在追一个未证实的传闻:The Information 说 Astra 用了「循环深度」——也就是 looped transformer。Raschka 花了几千字把这门技术从头到尾拆了一遍,然后给出自己的判断。
先说 Astra 本身。Raschka 认为它在 3D 渲染和动画上进步最大,写作、数学、编程也全面超过了 GPT-5.6。ARC-AGI-3 拿了 99.9%。但最让他兴奋的是 computer use——他让 Astra 在浏览器里用鼠标重画一张 MS Paint 图,模型真的会操作软件了。据称 OpenAI 为此买了上万台 Mac Mini 和 Mac Studio 当强化学习环境:模型看截图、预测鼠标键盘动作、harness 执行、新截图喂回去,成功失败当反馈信号。模型本体还是跑在英伟达 GPU 上,黄仁勋提过大约十万块 Grace Blackwell。

然后是 looped transformer。这个概念不新,核心是一句话:把同一组 transformer block 反复跑几遍,权重共享,用深度换参数量。一个 looped 架构的 transformer block 参数量大约只有等深常规模型的一半,省显存,但算力差不多——因为反向传播还是要穿过所有 44 次 block 应用。

Raschka 举了几个真实案例。北被 Nanbeige4.2-3B 把同一个 22 层栈跑两遍,得到 44 次 block 应用,结论是两轮最划算,三轮有提升但不值。字节的 Ouro 把 48 层栈跑四遍,192 次应用。而 2018 年的 Universal Transformer 是更早的原型,重复单个 block,带自适应停止——每个 token 根据学习的停止概率循环不同次数。
这些技术已经有人在开源模型上验证过了。9 月的 SMELT 论文甚至给出了 scaling law:在算力对齐的前提下,looped transformer 达到相同验证损失能省 6.8% 到 18% 的训练算力。换句话说,这条路在工程上是划算的。
但 Astra 到底用没用?Raschka 的态度很克制:「很可能用了,但它的成功主要来自更好的训练配方和数据,循环只是边际贡献。The Information 可能高估了它的作用。」OpenAI 首席科学家的说法是 Astra 的计算图深度「在 GPT-4 的两倍以内」,但这既可能是循环,也可能只是普通地叠了两倍的 block。
最值得琢磨的是推理链的缩短。Astra 的 benchmark 显示,在固定精度下它确实比 GPT-5.6 Sol 用的 token 更少。有人担心这是可解释性的倒退——如果循环把思考藏进了权重内部,外部看到的推理链就是「假的」。Raschka 不这么看:「用更少的 token 可能只是模型更能干了,错的更少,第一次就做对了。就像准备充分的学生,草稿纸用得少、不用频繁涂改。」他承认系统卡里 Astra 的推理链可监控性确实比 Sol 低,但那更多是因为链变短、信息变少,而不是循环被证实是元凶。
真正值得警惕的,是另一种可能性:如果 looped transformer 被刻意用来展示「假的」推理链,那才是问题。但目前没有强证据。OpenAI 首席科学家本人还特意出来澄清,说他是想「阻止一场由混乱报道引发的、奔向不可监控性的竞赛」,强调思维链监控依然重要。
一条线索串下来,Raschka 的落点是:Astra 强在 computer use,这才是下一个主战场;looped transformer 大概率在 Astra 里有一席之地,但别把功劳都算给它;推理链变短,更可能是「模型变聪明了」而不是「模型在藏东西」。
参考来源: