按月更新版本,我就问问还有谁?
7月Gemini 3.6 Flash、8月Gemini 3.7 Flash、9月Gemini 3.8 Flash。这更新频率也是没谁了……
3.6和3.7 Flash的提升不痛不痒,我原本已经彻底对Gemini失去信心了,看到3.8 Flash发布的新闻,我的期待值几乎就是0。不过还是试了试3.8 Flash,没想到虽是Flash模型,它这次在能力上的进步还挺明显。
01、单价没涨,为什么干活还贵了
3.8 Flash的Token单价和之前依然保持不变,3.6、3.7、3.8,连着三代更新竟然一点没涨价。
我们的美国大豆包价格上比豆包Seed2.1 Pro要便宜,甚至逼近了DeepSeek V4 Pro峰值的价格。

话是这么说,但是总价还是涨了。
因为这次3.8 Flash最大的特色是提升轮次。官方说以前Flash模型会出现活没干完就草草了事的情况,新模型解决了这一点。Gemini 3.8 Flash的解决办法是让模型多想一会,多说一点,任务多做几轮。

这就导致了一个问题。和前几代Gemini相比,虽然Token单价一直没变,但是同样的任务下,由于完成任务普遍轮次变多了,开销还是涨了。3.8 Flash高推理档位的单任务输出Token比3.7 Flash多了33%,加上智能体任务轮次增加,平均任务成本从0.40美元涨到了0.58美元。

有意思的是,Google对步骤多少的态度,还真不是一成不变的。
3.6 Flash发布时,官方强调的是少走弯路:用更少的推理步骤和工具调用完成任务;到了3.8 Flash,官方又开始强调要多想几步。
可是老大,我们这样让3.8 Flash多说话真的有用吗?
同样的提示词,分别让Gemini 3.7 Flash和Gemini 3.8 Flash给我讲讲电贝斯的发声原理。同样是让我拨动琴弦试试看,3.7说得很明白:「用力拨动4弦」;结果3.8来了个「用右手手指猛烈拨动最粗的4弦」……
????
Hello?我的钱都花在这了吗?


02、美国大豆包终于能把活干完了
话都说不明白,那这个多做几轮的方法到底在哪进步了?
原来,它是来干活的。这次迭代主要是Agent能力的提升。
Arena的Agent能力排名从上一代Gemini 3.7 Flash的32名升到了14名。

试了一下,提升效果还真挺明显。它的能力已经超越了大部分「Flash」等级的轻量级模型。
我让3.8 Flash做了一个四缸发动机的互动模拟,就用了1分钟,而且结果呈现的要素齐全。

作为对比,3.7 Flash在同样的提示词下直接什么都没画出来,我在提示词里还特别说明了「要做验证」。看来3.7果然为了赶快交差美美无视了这个部分……

让GPT检查才发现,不仅因为一开始的依赖加载出了问题,后面的旋转过程、点火顺序全都写的不对。果然一回头测试3.7 Flash,美国大豆包那个一本正经胡写代码的感觉又回来了。

和Gemini 3.7 Flash同样的问题也出现在各家的Flash模型上。
GPT-5.6 luna和GLM-5.3 flash全都没能加载出来渲染正常的的发动机活塞,后面旋转、点火过程也全都没有。而且这俩模型分别做了20分钟和35分钟,结果还是完全运行不了。


不过DeepSeek V4 Flash成功跑起来了,但只是能跑起来而已:气缸没画明白,四冲程点火的效果也完全没有体现。

03、质量不够,速度来凑
不过真要说Gemini和市面上其他模型比最大的优势,还得是速度。
Gemini系列现在的速度是真快,高推理模式下的3.8 Flash,每秒钟输出Token达到了300以上……
市面上所有推理模型里,速度前几名全都是Gemini。

这和Google给Flash系列模型的定位有关。
在官方的产品定位里,它的主战场是Agent,而且定位是调用工具、持续运行、落实任务的「worker agent」,不是那个深度思考、规定路线、统筹调度的「central agent」。所以它追求速度快、省Token,其实 3.8 Flash的表现很符合Google对Flash系列产品的定位。
我又一次拿出我的吃豆人做了测试。

我发现Gemini 3.8 Flash这速度真有点东西。整个游戏功能齐全,只用了29秒。这也太快了……

用相同的提示词测试了一下在Artificial Analysis同样在「智能」维度得到59分的GPT-5.6 Sol xhigh。结果要慢不少,做了1分35秒,另外这个结果真的不怎么样,这个帧数是要干啥……

,

为什么3.8 Flash作为一个轻量模型还能在很多测试任务里保持质量?
因为对于它来说,高速是多做几轮的条件。
我看Google最近的Flash系列大更新是一次挺漂亮的曲线救国。
曾经的大模型发布是先做个旗舰模型,然后蒸馏出来一个轻量快速的Flash模型。但是由于Gemini 3.5 Pro的「持续难产」,Google选择反其道行之:质量不够、速度来凑。3.6、3.7的模型还是在一味地卷速度,但是这次的3.8 Flash,Google是真做到了利用高速优势,达到更好的质量。
用这种优化方式,Gemini 3.8 Flash的能力已经能算是「旗舰级Flash」模型了,但是它毕竟依然不是Pro。现在都已经9月了,原定6月发布的Gemini Pro模型到底啥时候能发出来,我真的等不及了。
本文来自微信公众号 “硬核看板”(ID:yinghekb),作者:王芮,36氪经授权发布。