首页 > 资讯 > 数据中心,正在拆掉Token时代的旧围墙

数据中心,正在拆掉Token时代的旧围墙

钛媒体 2026-10-08 12:17 8 阅读 查看原文

(本文作者为 硅碳变量,钛媒体经授权发布)

文|硅碳变量,作者|沈浪

9月17日,在2026 ITValue Summit数字价值年会上,超聚变算力领域副总裁王梁栋指出,伴随大模型能力加速演进,AI进入推理为主的“干活”时代,全球Token消耗将持续爆发,促使AI基础设施同步进化。

当下算力行业的竞争逻辑正在迭代,单纯依靠堆叠服务器和扩张硬件规模的粗放式发展路径,效用持续减弱。

随着AI重心从模型训练转向海量推理,算力基础设施正在经历底层变革,传统“堆硬件、扩规模”的建设思路,越来越难以匹配新阶段的产业需求。

Token的真实账单

Token不是噱头,是AI产业正在面对的真实账单。

当市场还在热议大模型参数、评测榜单这些显性指标时,一组持续攀升的Token调用数据正在揭示AI产业底层逻辑的转向:算力价值的重心正从一次性训练的峰值能力,向持续不断的推理开销迁移。

3月23日召开的中国发展高层论坛2026年年会透露,今年3月,中国日均Token调用量突破140万亿,相比2024年初的1000亿,两年增长超千倍。同月,中国AI大模型周Token调用量连续三周超越美国,成为全球 AI 应用活跃度最高的国家之一。 

来自全球最大AI模型API聚合平台OpenRouter的数据,进一步印证国内AI应用端的爆发。3月16日至22日,全球AI大模型总Token调用量为20.4万亿,仅中国就达7.359万亿,占全球的36%。

国内海量企业应用与智能体场景的规模化落地,正在推高Token消耗,让国内调用规模站上全球高位。

面向未来,多家机构给出了极具冲击力的预测数字。根据摩根大通的最新预测,中国AI推理Token消耗量将从2025年的约10千万亿增长至2030年的约3900千万亿,五年间增长约370倍。

IDC的判断则更为大胆,全球年度Token消耗量将从2025年的0.0005 Peta Token增长至 2030年的15万Peta Token,年复合增长率高达3418%;到2031年,全球活跃智能体数量将达到3.5亿个,而单智能体Token消耗量可达传统对话应用的百倍乃至千倍级。

和一次性问答对话不同,智能体需要自主规划任务、多轮调用模型以及反复试错迭代,每一次动作都会持续消耗Token。一旦智能体场景规模化铺开,算力层面的成本账单或将持续走高。

当然,不同机构采用的统计口径和假设条件存在差异,数字本身不必纠结谁更精准,但背后的产业方向高度一致:AI算力的重心,正从一次性训练,向持续性推理迁移。 

AI发展早期,行业叙事重心落在训练上。基座大模型训练属于一次性重投入,赛道比拼的是模型规模与参数上限。彼时客户挑选算力的思路相对简单,通常优先考量GPU显存和单卡峰值算力,市场竞争也围绕瞬时峰值性能展开。

当行业转向推理主导,算力的商业逻辑正在出现明显转变。推理不是一次性任务,而是7×24小时持续运转的流水作业。大模型嵌入各类业务系统,不间断承接用户请求和执行业务任务,算力集群必须长期在线。客户衡量算力方案的标尺,也随之调整。

客户不再只聚焦单卡峰值算力,转而更看重落地场景里的现实指标:集群单位时间能稳定输出多少Token?单个Token的电力与硬件折旧成本,能否控制在业务可承受范围?大规模集群长期运行,能不能稳定跑满负载,减少宕机带来的业务中断和额外损失?

简单来说,训练比拼的是算力“爆发力”,推理考验的是长期稳定输出的能力与单位Token成本。

训练是阶段性投入,基座训练任务收尾,大规模算力即可释放;推理需要长期在线承接请求,每新增一个Token,都会产生一笔实打实的成本。

这正是Token数据值得重视的原因,它不只是发布会用来烘托热度的宣传素材,更是真实业务流量的写照,代表算力基础设施需要承接的业务压力,也是企业经营难以回避的成本账单。 

这一变化,正在从需求端反向重塑AI算力产业链。

随着行业需求向高吞吐、低成本、高稳定性的推理集群倾斜,服务器架构、液冷方案、集群组网都迎来迭代压力。厂商竞争的评价维度,也从单卡硬件参数,向整套系统持续生产Token的效率延伸。

算力竞争的主战场,正在发生偏移:不再局限于实验室的训练任务,海量Token持续产出的真实业务场景,成为新的竞争阵地。

"8卡服务器" 这层窗户纸,快捅破了

过去几年,AI数据中心的主流标准单元是8卡服务器:将8张GPU集成在单机箱内,接入网络,再批量部署数百上千台,配合配套设施,就能搭建行业所说的“万卡集群”。

这套架构在模型参数维持在百亿、千亿级的阶段尚能胜任,但当模型走向万亿参数,百万路并发的推理请求持续涌入,原有架构的短板开始集中暴露:卡与卡之间、服务器与服务器之间的数据搬运,往往是制约性能的核心瓶颈之一。

即便芯片本身算力强劲,一旦数据无法及时送达,硬件算力便容易闲置,算力优势难以充分释放。

中国信通院在《AI 计算节点发展研究报告(2026 年)》里把这件事讲得很清楚:超节点的核心突破之一是通过在单节点或高密度机柜内大规模部署NVLink等卡间直连技术,将数十至上百张加速卡整合为一个内存统一寻址、算力无缝调用的“超级计算单元”。卡间通信带宽显著提升,延迟明显降低,解决了张量并行等紧耦合任务中的通信瓶颈。

换个通俗的理解就是,与其采购1000台独立服务器,再依靠网线做跨机互联,不如将数百颗芯片以更高密度的互连方式,整合为一台逻辑层面的大机器。

钛媒体在《超节点如何成为AI算力的新答案?》一文中指出,超节点本质上就是把高带宽互连域从8卡扩展到64卡以上,让卡间通信变成接近内存访问的低延迟操作。

业内专家告诉钛媒体,大模型正在从能训练、能运行进入规模化生产阶段,问题不再是单卡峰值和卡数,而是系统能否稳定承载模型、持续产出有效Token,同时控制时延与总成本。

这种架构迭代思路,并非单一厂商的独家创新。

比如,华为在全联接大会2026上发布的昇腾960超节点,单节点4096卡规模、提供8E FP8算力;联想在WAIC 2026展出了万全异构智算平台V5.0超节点方案;超聚变这类从服务器整机起家的厂商,则把FusionPoD for AI这样的整机柜方案推到台前。

赛道里的玩家各有侧重,但行业共识正在收敛:中大型AI数据中心的建设思路,选型重心正从零散采购独立服务器,向整机柜和系统级一体化方案倾斜。

很长一段时间里,8卡服务器是AI算力基建的基础单元,也是行业沿用多年的主流范式。当产业重心以基座模型训练为主时,企业批量采购标准化8卡服务器并组建集群,可用于开展模型验证与早期训练工作。

这套模式标准化程度高且供应链成熟,支撑了前一轮大模型的快速落地。

不过当行业重心转向推理场景,海量Token持续消耗形成的业务压力,正在逐步显现这套架构的固有短板。跨服务器之间频繁的数据交互会带来持续的通信开销,容易拉高延迟,也推高电力与运维层面的综合成本。

随着业务对Token吞吐、集群稳定性、单位Token成本提出更高诉求,单纯堆叠8卡服务器的方案,边际效益或将逐步走低。超节点方案的兴起,可以看作行业试图突破8卡服务器架构局限的一次尝试。 

当然,这并不意味着8卡服务器会快速退出市场。小规模研发测试、轻量化模型、边缘推理等场景下,8卡单机仍保有灵活、成本可控的优势。 

但面向承载大规模并发、海量Token消耗的中大型AI数据中心,依靠大量独立 8 卡服务器组网的传统范式,在适配业务需求上正面临越来越多挑战。

超节点不是算力终极答案

首先,超节点的价值有其清晰的场景边界,并不是可以覆盖所有业务的万能算力方案。

作为为大模型超高负载、高并发业务量身打磨的架构,超节点的性能与成本红利,更多体现在万亿参数模型训练、大规模推理集群这类高门槛大算力场景,也只有在这类场景下,它的价值才能充分释放。 

在这类场景中,高密度互联、低延迟通信的架构优势可以显著改善传统8卡服务器集群面临的通信瓶颈,有效提升Token吞吐能力,压低整体算力成本。

但对多数中小规模业务来说,像轻量化模型迭代、小批量 API 服务、小规模研发测试、边缘推理这类场景,算力需求不大,业务架构也更为简单。这种场景下若强行部署超节点,很可能受架构冗余、系统复杂度上升、硬件深度绑定等因素影响,抬高部署与运维开支,让整体TCO显著上升。

其次,底层互联的技术路线还未走向收敛,方案选型仍有不少不确定性。

算力集群的通信能力,很大程度上决定超节点能达到的实际吞吐上限。目前行业正处于多条互联路线并行博弈的状态:NPO 近封装光学、CPO 共封装光学与传统光模块各有所长。厂商依托自家芯片与硬件架构选择不同方案,统一的行业标准还未落地。

昇腾960超节点将4096卡规模、FP8 8 EFLOPS算力与“5500个Hi-ONE替代4.8万颗 800G光模块”的革命性互联方案一并抛出,走出一条差异化的工程落地路径。而多条技术路线并行的格局,也意味着客户需要直面潜在选型风险。

倘若客户当下重金锁定某一类互联架构,一旦后续行业主流技术发生转向,硬件兼容改造、设备升级都会带来额外开支,前期投入的算力基建,可能遭遇技术迭代引发的资产折旧压力。

第三,还有一道所有算力基建项目都无法回避的现实拷问:硬件建成,集群能不能跑满? 

算力项目是典型重资产投入,服务器、液冷与互联硬件前期一次性开支高昂,资产折旧周期漫长。即便超节点依靠架构优势提升了单卡利用效率,一旦缺少稳定持续的业务流量承接,再领先的硬件都可能闲置,居高不下的固定成本会持续侵蚀企业利润。

arXiv上一篇研判2026—2030年AI基础设施的论文提到:通过KV压缩、稀疏性处理、量化以及路由到更小模型,每个Token传输的字节数每年以约30%的速度下降。Token年增长率为1.5倍时,到2029年集群利用率将暴跌至约45%,随后出现大规模产能减值;增长率为2.0倍时,系统基本平衡;增长率为2.5倍及以上时,整体产能将持续短缺,即便峰值周期的集群也能保持偿付能力。 

换句话说,超节点解决的是如何更高效率产出 Token的技术命题,却很难回应一个更底层的商业疑问:产出的这些Token,能不能获得持续稳定的付费需求承接。

算力行业进入新阶段,竞争重心早已不是单纯堆叠更多芯片。真正的考验在于能否把每一张加速卡和每一度电,可持续地转化为市场愿意付费的AI服务。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App