首页 > 资讯 > 黄仁勋三次断言翻车,CUDA护城河,被谷歌一行代码凿穿

黄仁勋三次断言翻车,CUDA护城河,被谷歌一行代码凿穿

36氪文章 2026-09-10 10:53 3 阅读 查看原文

英伟达死守的推理性价比神话,碎了。

就在刚刚,SemiAnalysis发布了谷歌第七代TPU Ironwood的首份第三方推理性能测算。

在完全对等的模型负载下,TPU的每美元性能最高领先英伟达B200达50%,对B300的领先幅度更是逼近翻倍的96%!

外部TCO口径下每百万token成本 vs 交互速度

换算成业界最敏感的每百万Token成本,差距触目惊心。

TPU仅需0.181美元,B200为0.222美元,B300则高达0.276美元。

更戏剧性的,是时间。

今年4月,黄仁勋在Dwarkesh播客上宣称TPU与Trainium都不敢来跑分。他甚至公开鼓励挑战者使用InferenceMAX来证明其所谓的推理成本优势。

五个月后的今天,TPU带着致命的数据如约而至。

黄仁勋的三次断言

在那期播客中,黄仁勋对TPU的战略藐视可以归结为三次断言。

第一句,他表示极度渴望看到对手证明TPU的成本优势,并认定这在逻辑上根本无法成立。

这次的测试方法,完全公平公正——

同款开源模型,FP8对FP8,输入8k输出1k,B200与B300跑的是和TPU完全一致的负载。

在每秒100 Token的单用户吞吐基准下,TPU比B200便宜19%,比B300便宜34%。

若将中位响应时间卡在20秒,TPU成本为0.098美元,B200是0.106美元,B300则飙升至0.132美元。

B200并未在所有指标上落败。在30秒响应时间的狭窄区间内它依然维持着微弱的抵抗。但随着延迟要求放宽,TPU重新接管了制高点。

至于B300,则全程处于成本劣势。

每百万token成本 vs 端到端延迟

第二句,他声称从第一性原理来看,TPU的优势完全没有道理。

物理测试并未推翻他的底层推演,黄仁勋只是算错了商业世界的算盘。

在原始吞吐曲线的大部分区间内,TPU的物理性能确实不及GPU。但TPU的每小时租赁成本呈现出断崖式的低廉。

5%的物理吞吐优势叠加极低的单位时间租金,瞬间转化为50%的每美元性价比优势。

若按谷歌内部每颗芯片一小时1.03美元的底线成本核算,这一优势将被放大至77%乃至130%。

单加速器吞吐 vs 交互速度

黄仁勋计算的是单颗芯片榨出的绝对算力,而商业客户衡量的是每一张钞票能买到的实际产出。

这次公开的跑分数据直接击穿了客户侧的心理防线。

谷歌内部TCO口径

第三句,他断定Anthropic只是特例,失去Anthropic的支撑TPU将彻底丧失增长引擎。

这项断言目前仅维持了表面上的成立。

Anthropic确实吞下了超过100万颗TPU,其中约40万颗直接买断,60万颗通过谷歌云租赁。到2029年它将超越DeepMind成为全球最大的TPU单一用户。

但另一半断言正在迅速失效。

谷歌自去年起便开放了芯片直售,不再死守云端租赁这一单一城池。就连DeepMind内部的研究员,如今也需要在拥挤的队列中抢夺算力资源。

黄仁勋4月敢那么说,是因为TPU在外面从来没有标过价。

现在,价标出来了,还是别人替谷歌标的。

TPU的成本深水区

一颗专用芯片究竟如何实现对通用GPU的成本倾轧?

对此,SemiAnalysis在底层逻辑上揭示了谷歌截然不同的工程哲学——

谷歌从不单一追求芯片的物理峰值,而是将计算Die、芯片间互联以及底层编译器铸造成一个闭环系统,在每一处接缝中压榨成本。

芯片层面,Ironwood被物理拆解为两个独立的计算Die,每颗内嵌2个TensorCore与4个SparseCore。

其HBM容量达到了上一代Trillium的6倍。这个数直接决定KV Cache能放多大、Batch能开多大。

它更是第一代原生支持FP8运算的TPU,彻底告别了此前数代的软件模拟妥协。

矩阵单元采用256×256的脉动阵列,每周期完成65536次乘加运算,计算吞吐量直接飙升至v5架构的4倍。

这条路线到第八代走得更绝:谷歌第一次把训练和推理拆成8t、8i两颗芯片,8i的片上SRAM扩到384MB、是上代3倍,专门把推理模型的KV Cache留在片上。

谷歌TPU各代规格对比

网络互联方面,芯片之间直接通过谷歌自研的ICI总线进行数据交互,彻底绕开主机CPU、PCIe与通用网卡。

其拓扑结构呈3D Torus形态,每颗芯片物理链接6个相邻节点,64颗组建为一个机架级立方体,再通过光学电路交换机一路拼接至9216颗芯片的超级矩阵。

TPU v7的4×4×4立方体逻辑配置

任何一条光纤链路发生故障,系统都能利用光学反射镜在数秒内完成重路由,不需要人工干预。

到TPU 8i,3D Torus会换成Boardfly拓扑,千颗芯片规模下最大跳数从16砍到7,MoE路由和多轮Agent里每一跳堆出来的尾延迟直接减半。

Google,TPU 8i的Boardfly拓扑

压榨50%性能的代码级重构

极致的性能表现往往潜藏在底层软件的暴力重构中。

为了让TorchTPU栈上的第一个模型顺利起跑,谷歌、Inferact与RadixArk联手投入了数百个工程小时。

深入剥离海量的代码提交记录,可以萃取出三项具备决定性意义的优化。

第一是KV Cache页数翻倍,大幅削减首Token延迟。

TPU向量单元每次处理的Tile在最后一维被硬件锁死为128个Lane,维度不足便会被强制补零。

旧有的注意力内核沿着头维度打包KV,导致单KV头的模型有一半计算资源被无效的补零操作吞噬。

现在,谷歌将Token转移至128 Lane的维度,可用KV页从5141暴涨至10283。

在并发128时吞吐量提升16.5%,中位首Token延迟骤降95%,推理请求彻底免除了排队等待KV空间的痛苦。

KV cache布局改造前后对比

第二是参数拆解以提升解码吞吐。

分页注意力机制依靠双缓冲来掩盖HBM延迟,即计算当前数据时同步预取下一块数据。

旧的启发式算法将计算块和读取块均锁定为16k个Token,导致VMEM没有任何多余空间用于预取操作。

现在,研发团队将读取块维持在16k,计算块砍至4k,解码吞吐量从每秒64.9k Token跃升至96.3k。

读取块与计算块拆分前后

第三是通信任务向SparseCore的转移。

Ironwood每颗芯片配备的4个SparseCore原本专属于Embedding查表等稀疏计算。

谷歌将ReduceScatter和MoE的Token重排任务全部转移至SparseCore,从而释放TensorCore的计算资源使其专注核心矩阵乘法。

SparseCore上的ReduceScatter三阶段

在8k输入1k输出的负载下吞吐量提升4.1%至14.2%,在1k输入8k输出且并发512时吞吐暴增26.1%。

数百个这样微小却致命的代码优化层层累加,最终铸就了这压倒性的50%性能优势。

填平生态护城河的代码级颠覆

这次更新最颠覆的地方在于,谷歌只是动了动软件。

整个开源推理生态在此之前深深扎根于PyTorch与CUDA体系,而TPU的原生开发环境是JAX。

此前vLLM要跑在TPU上,得靠一层叫TorchAX的翻译墙,在底层把每个算子逐一翻译为JAX执行。

这层翻译导致了分页注意力与底层优化的大量兼容问题,谷歌联合开源社区耗费一年多时间才完成修补。

此前的JAX/TorchAX服务栈

如今TorchTPU直接炸毁了这层翻译墙。

它利用PyTorch自带的PrivateUse1后端接口,令TPU直接成为原生的Torch计算设备。

开发者仅需敲下一行代码即可将编译交由XLA处理,性能核心算子调用Pallas内核,而DDP与FSDP2等分布式特性均可无缝运转。

TorchAX路径 vs TorchTPU原生路径

对于vLLM和SGLang等框架,其调度器与API层等核心代码现在能够直接复用,彻底终结了隔着高墙重新造轮子的历史。

此前耗费海量工程时长打磨的Pallas内核绝大部分可直接空降至全新环境。

CUDA的帝国城墙由两部分垒成。一层是底层芯片性能,另一层则是封闭的生态铁幕。

如今的跑分证实了其物理性能的不可替代性已被实质性打破。

而那道曾让无数挑战者铩羽而归的生态铁幕,正在被PyTorch底层架构的更新以不可逆的方式逐步填平。

参考资料:

https://newsletter.semianalysis.com/p/tpu-inferencex-full-steam

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西,36氪经授权发布。