谷歌发了新模型,Gemini 3.8 Flash。
早上起来,订阅号里已经全是它的实测。什么结论都有,有的说强得离谱,有的说不过如此,有的干脆阴阳怪气。
我前几个月还会点开看看,这两个月基本划走;博主们其实挺努力的,可这事在结构上就测不出来。
我有个疑问一直没解开,一个万亿参数的模型,发布 48 小时,一个人凭什么说它好不好。要解开它,得过三道坎。
第一道坎,它没给你留时间。
谷歌这次离上一代只隔了 20 天。往前数,3.6 是 7 月 21 日,3.7 是 8 月 13 日,3.8 是 9 月 2 日。43 天三代,六周里第三款。
皮查伊在财报电话会上跟股东承诺,节奏要快到接近每月一个新模型。产品规划这个词已经不够用了,这就是一张排班表。
你上个版本还没捂热,评测结论还没吵完,下一款已经来了。而且这个 3.8,官方自己承认是在 3.7 的基础上接着练的,规格一个没动。
相当于同一个学生又补了一学期的课,没换学生。
进步是真的。DeepSWE 编程榜上它拿了 73.7%,Claude Opus 5 是 74.0%,差 0.3 个百分点,几乎打平。
这成绩单摆在那,谁要说谷歌原地踏步,那是不讲理。
可问题也在这。验证一个模型要多久,至少得让真用户拿着真任务用上几周几个月,谷歌给的时间是 20 天。
验证周期赶不上换代周期,你刚测出点门道,它已经过时了。三周前那批 3.7 的实测稿,现在读起来已经像考古。
第二道坎,你摸不全它。
万亿参数,大到你靠肉眼、靠手动,根本量不出。谷歌没说 3.8 到底多大,反正前沿模型动辄这个量级,能力空间的边界在哪,没人说得清。
我看国外一位在 GitHub 做模型的工程师说过一句大实话,没人知道新模型发布时有多好,连做它的实验室都在猜。
可你真上手,能踩到多少。几段对话,让它写个低代码网站,做个八竿子打不着的小游戏,再问两道脑筋急转弯。
这些只是那个空间里随手戳的几个点,采样量约等于零。
更麻烦的是,测出来的结果还不稳定。同一个提示词,博主 AI Pulse Daily 让三个模型生成纽约城市场景,Opus 5 塞了 1840 棵树,谷歌三周前那版放了 10 棵,新出的 3.8 只放了 6 棵。
提示词里点名要的人行横道、水面波纹,3.8 全给略过了,倒是自作主张加了五个摄像机预设。
另一拨人拿差不多的任务去测,3.8 又快又便宜,0.12 美元干完四个场景,Opus 5 花了 1.86 美元。
模型是同一个,结论是反的,差别全在测试者选的那道题上。
第三道坎,你摸到的不是它。
谷歌发布会的 demo,一句提示词生成一个能玩的 3D 巫师游戏,谜题、环境叙事都给你搭好了,再做一版能跑起来的 DOS 版谷歌地图,连街景导航都有。看着确实唬人。
但这些是谷歌拿自家框架、自家环境、反复调教之后跑出来的上限。
早上我也看到一篇反着测的稿子,自己上手跑了一遍,结论跟官方正好相反。六周连更三代,稿子里四个字,圣质如初。
普通人拿到的是什么?
一个网页,一个 API,一个光秃秃的对话窗口,没有那套框架,也没有工程师在旁边伺候,你发出的是一句没头没尾的自然语言。
谷歌给你看的,是整支团队围着喂出来的效果。你手上的窗口,没人伺候。发布日你能测到的,是它摆出来的那块。
你看,三道坎,时间不够,能力不够,摸到的还不是它,有什么卵用?
......
没什么卵用,可他一天也没有断过,因为发布模型、发布这套内容,本身干的就不是验证的活。
我特意扒了一下这个细节,扒完发现,这场狂欢的开幕,比媒体的稿子早了好几天。
华尔街在发布前一天就放风了。
谷歌内部有个编码平台叫 Jetski,工程师拿 3.8 跟 Anthropic 的 Opus 做头对头测试,多数人更偏好谷歌这个新模型。
消息里没有提示词,没有任务集,没有测试方法,就一句结论。可就是这么一句话,报道当天 Alphabet 盘后涨了 0.6%。
再往前翻几天,Business Insider 先报了一轮。
谷歌员工在 Jetski 上试 3.8 的预览版,有人说明显好过 3.7,末尾补了一句,全面评估还为时尚早。这一句,后来没有一家转载。
更早一天,3.8 模型卡在官网冒了个头,又被撤了下去,页面变成 404,好在有人截图存了证。
再往前翻,8 月 10 号腾讯一篇论文里,已经把「Gemini 3.8 Flash」列进评测裁判名单,那会儿 3.7 都还没公开发布。
你看,发布还没开始,测试已经跑在传播线上了。
厂商心里清楚,光开一场发布会不够,还得让全行业替它实测一遍,稿子越多越好,夸的骂的都行,只要时间对。你要的「实测」,是人家端上来的菜。
稿子呢?也齐得很。
零点刚过,第一篇实测上线。到早上八点半,五家头部科技媒体全部交卷。标题全是一个套路,刚刚、光速、又双叒、邪修、惨遭嘲讽。
抢的就是那个「刚」字,凌晨的「刚刚」和中午的「刚刚」,不是一个东西。同一批网友测试,几个小时里被转了个遍,标题从「性价比杀器」换成「惨遭嘲讽」,正文大差不差。
为什么这么齐?
发布日的流量窗口就 48 小时,窗口一过,稿子没人看,吃这碗饭的,吃的是窗口饭。
我也查了查,清醒的人有没有。有。英文圈一位做 AI 的从业者公开说,她拒绝评价上线才 15 分钟的模型,要等一周,让模型先稳定下来。
可这种人不靠发布日吃饭,他们的话,也挤不进发布日的版面。
好,媒体扒完了,再往严肃里扒,机构也在场。
发布当天,Artificial Analysis 的分就出来了,59。Datacurve 的编程榜也当天交卷,74%,跟 Opus 5 并列第一。
这俩机构是正经做评测的,任务集公开,结果能复跑,质疑它们的人不多。可越正经,越说明问题,连它们都赶在发布日交卷。
其实机构天天在出数,前一天 Anthropic 的 Fable 5.1 刚拿了 Artificial Analysis 有史以来的最高分 66,也没见谁刷屏。
只有发布日这天的分数,才有人转发。发布时间表支配所有人,最严肃的评测,也得在窗口里才有观众。
还有更逗的。Arena 自己的说明里写着,榜单反映的是用户主观偏好,不是绝对能力测试。平台自己先把底牌掀了。
再扒最后一层,读者。
互斥的结论能同时上头条,因为两头都有人看。吹爆的、踩爆的,都是现成的站队材料。至于模型本身好不好,没人在乎,在乎的是自己押的那边赢了。
我看了一下,小红书上那些实测稿的评论区,吵得最凶的,全是还没决定用哪家的人。吵赢了,仿佛自己已经用上了。
看实测有点像看球评,图一乐没什么不行。差别只在一个装字,球评明说自己是看热闹的,实测顶着「实测」两个字,让你以为自己在做判断。热闹看完了,选边也选完了,模型好不好,没人记得问。
一场戏,厂商写剧本,媒体跑龙套,机构赶场,读者站队,各有各的位置,演完,没有一个人拿到验证。抽象吗?
......
不抽象。真正的验证,其实一场都没缺席,只是全都不在发布日。它们要么关起门来,要么姗姗来迟,就是不肯在狂欢当天到场。
顺着验证找,分两头:一头在发布之前。
OpenAI 把 GPT-5.6 Sol 提前拿给美国政府预览,商务部下属的机构从 5 月开始,能拿到谷歌、微软、xAI 没发布的模型做预部署评估。
OpenAI 六月自己发过声明,提前把模型给政府看,是为了让公开上线来得更顺,是短期安排,先过政府的关,再过市场的关。
谷歌这次出 Cyber 版,只对审核过的安全团队开放,OpenAI 的 Astra 因为网络安全能力触了线,干脆做了受限发布。
马斯克还提议,让同行互相审,政府最后兜底。
每个发布日的背后,都有一轮你见不到的考试,这些考试是真的,也值得做,可它们不公开,结论也不替你做判断。它们管的是安不安全。
另一头在发布之后。
GPT-5 上线那天,全网一片唱衰,共识是这模型不行;三个月后风向变了,它成了 agent 编程的一把好手,很多人回头才发现自己当初骂早了。
当初骂 GPT-5 的人,不是瞎。
人判断模型靠感觉,可模型一旦聪明过你,感觉就失灵了,你连它强在哪都看不出来,自然说不到点子上。发布日共识老是翻车,根子在这。
我自己也踩过这个坑:
DeepSeek 的 V4 Pro 发布时,满屏都是夸,我用了一阵,反噬就来了,圈里开始说它拉。
可我日常用的最多的反而是 V4 Flash,Agent 调度比 Pro 利索,token 花得还少,跑 Loop 任务命中率基本能到 98%,Pro 有时候还到不了。
发布日被捧上天的 Pro,和日常被低估的 Flash,角色正好是反的。
翻案要三个月,发布只要 20 天。等你把一款模型用出结论,下一场狂欢已经开场,把对话重置了。
圈里有人总结过这套节奏,一台专门制造突破感的机器,感觉准时到站,每几周一班,突破到底来没来,另说。
社区测试能测出东西吗,能。可那是拿真任务连用好多天换来的,发布日这 48 小时的齐射,不在一个量级。
回到最开始那个问题,发布日满屏的实测,测的到底是什么?
发布日真正产出的,是人的注意力报告。哪篇稿子有人点,点完停几秒,评论区吵成什么样,转发进了哪个群,这些才是那天���精确测量的东西。
这套测量精密得很,稿子发出去,打开率、完读率、划走的位置,全是数据;什么标题能让人点进来?什么结论能让人吵起来?厂商摸得门儿清。
测完各取所需,热度曲线、流量账单、站队材料,各有各的去处。模型只是个由头,你在挑模型,人家也在挑你。
与其人测它,不如它测人。
这套玩法,手机圈早就演过一遍。当年手机评测也走过这条路,媒体机、首发稿、厂商供料,一套流程跑得飞起。
演到今年 6 月,央视曝光了,厂商给博主特供「作弊机」,从硬件到云端三层造假,博主测的手机跟老百姓买到的,不是一回事。
可手机至少有帧率可测,造假才有得做;AI 模型连测什么都定不了,连造假都省了。
那这套狂欢的清算,会以什么形式来?什么时候来?没人知道;能确定的是,模型好不好,时间会给答案,只是那个答案,永远赶不上发布日的版面。
下次有人拿发布日实测跟你安利,就回他一句:
你那碳基大脑,真能测出一个万亿参数的大模型好不好用吗?
数据来源:
[1].谷歌官方 Gemini 3.8 Flash 模型卡与 DeepMind 发布博客,华尔街日报与 Business Insider 的谷歌内部测试报道,Artificial Analysis、Datacurve 等独立评测数据,AI Pulse Daily、AI/ML API 等开发者公开实测;OpenAI 官方博客与美国商务部公告,信息截至 2026 年 9 月 3 日

本文来自微信公众号“王智远”(ID:Z201440),作者:王智远,36氪经授权发布。