9月22日的云栖大会上,阿里重新将大模型的“大参数”路线摆上台面。
阿里CEO吴泳铭现场披露,阿里正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。
随后,阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒也在现场提到,Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。
同一天,另一则消息在行业流传:据The Information报道,DeepSeek目前正在训练一个约2万亿参数的新模型;DeepSeek创始人梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。
时间再往前推两个月,8月,英国《金融时报》援引知情人士称,字节跳动正在训练一个最高可达10万亿参数的大模型。
参数,可以通俗理解为大模型的“脑容量”,即模型推理计算时调用的经验权重总量。那10万亿是什么概念?对比2025 年引爆行业的DeepSeek-R1,其当时的参数量仅6710亿,不足10万亿的十五分之一。
从阿里到DeepSeek,再到字节,国产大模型公司集体重拾参数“越大越好”的信仰。
但规模竞赛的另一面:参数越大,投入的资源和成本就越高,而智能并不会同倍增长。模型扩大之后,数据必须跟着扩大,而且不只是数量,质量也得提高。当所有人都在堆参数,真正的分水岭就变成了算力效率,即单位算力能换回多少智能。
阿里、DeepSeek、字节下场豪赌10万亿参数
在已发布的模型里,国产阵营的顶点是月之暗面7月推出的Kimi K3,总参数2.8万亿,是全球首个开源的3万亿级别模型。阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。
如果将视线转到海外,闭源阵营的参数规模更高。业内估计,Anthropic的Mythos 5约8万亿参数,Fable 5约5万亿。
也就是说,国产已发布模型的参数顶点,距离海外估计的头部水平,还差着一到两倍的身位。而若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍。
那么问题来了,参数越大,真的越好吗?
支撑“越大越好”这个观点的逻辑指向Scaling Law(缩放定律),指的是在模型、数据、算力三者同步放大时,模型能力会随之提升。
过去几年,从千亿到万亿,每一次参数跃升,都伴随着能力肉眼可见的跳跃。理论上来讲,参数越大的确意味着性能越高。
而这也是刘大一恒把Scaling说成是阿里实现ASI关键路径的底气。
但Scaling Law并不是无限有效的。它需要有前提保证,在参数变大的同时,数据量和算力也得同比例跟上,而且是“高质量数据”。
到了万亿级别,单纯堆参数,边际回报明显递减。所以,从现实角度来看,一个所谓的10万亿参数的模型,如果喂不进等量的高质量语料,能力不会同倍提升。
还存在的变量是,数据、训练方法、架构,以及推理时的算法。
比如Kimi K3总参数2.8万亿,但用了MoE(混合专家)架构,896个专家每次只激活16个,实际激活参数仅约1040亿。也就是说,名义上是2.8万亿,真正干活时动用的远没有这么多。
放到实际使用中,参数大也不等于“好用”。
一方面,模型越大,推理越慢,用户等待的时间肉眼可见地拉长。另一方面,推理成本随之水涨船高,最终会转嫁到价格上,即便只是几千亿乃至两三万亿参数的旗舰模型,用户的实际使用成本也已经相当高。
所以绕开“好不好用”,回到竞赛本身:参数规模决定的是能力上限,而上限决定排位。
这正是阿里、字节、DeepSeek明知边际递减、成本高企,仍要冲向5万亿到10万亿的原因,大参数争的不是当下体验,而是下一代模型的入场券。
10万亿的账单:大模型烧钱,谁扛得住?
超级模型固然能触碰更高的智能,但更大的底座,意味着更多的训练与部署资源。大模型烧钱,已是各家大厂心照不宣的共识。
海外,微软、谷歌、Meta、亚马逊四家的资本开支,2026年指引已飙至约7200亿—7450亿美元。
国内市场同样激进:阿里2026年Q2单季资本开支677亿元,同比大增75%,自由现金流由正 738 亿元骤转为负466亿元;字节2026年资本开支上限最高可达700亿美元,约为上一年三倍,2027年还可能再冲1000亿美元。
钱花在哪?最直接的一笔,是基础设施。
OpenAI训练GPT-4时,算力需求以千亿Token计,成千上万张GPU要在高速互联的集群中协同运转数周乃至数月,那时GPT-4的参数量只有2万亿。
而10万亿参数的预训练,需要的GPU数量与时长还要再上数十个台阶,意味着数万张高端GPU连续跑数月,电费、集群运维、芯片采购,每一��都是天文数字。
单从数据中心的投入来看,云栖大会上,吴泳铭宣布阿里云到2032年运营的全球数据中心规模将超过20GW;高盛此前估算,阿里目前已上线容量约3—4GW。这意味着,未来六年要新增约16—17GW,规模扩大到目前的5倍以上。
参照英伟达黄仁勋曾在财报电话会中透露的信息,建设1GW算力的成本约为500亿—600亿美元 —— 按此推算,阿里未来六年新增的16—17GW,总建设投入可能达8000亿至1万亿美元量级。
其次是推理成本。模型训练完不是结束,而是开始。参数越大,每次生成回答调用的算力越多;当模型部署到千万用户的日常调用中,推理侧的电费与算力开销,往往比训练更持久、更烧钱。
还有一笔容易被忽视的隐形账单:数据。模型扩大,训练数据必须同步扩大,且不只是数量,质量也必须提高。当前行业共识是,高质量、经过精细清洗和标注的数据,比裸算力更稀缺。
三笔账单摆在面前,玩家们扛得住吗?
现金流已经给出了预警。过去5个季度,阿里自由现金流有4个季度为负。最新一个季度资本开支高达677亿元。账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于AI基础设施。
但面对万亿美元级的��力投入,这点弹药远远不够,持续的外部融资几乎不可避免。
字节的情况如出一辙。据The Information报道,字节跳动今年上半年净利润同比下降个位数百分比,至约200亿美元。它是国内科技巨头中AI资本开支最大的公司,2025年AI相关投入达1500亿元,2026年进一步增至2000亿元。
缺口之下,字节近期完成了约300亿美元的银团贷款,规模为科技公司史上最大,部分资金预计将投入持续扩大的AI基础设施。
一场停不下来的军备竞赛:从Flash到10万亿参数
云栖大会前不到一个月,阿里刚把Qwen3.8-Flash-Next推到台前:1250亿总参数,每次推理只激活60亿,训练成本较前代砍掉近90%,API定价最低到DeepSeek-V4-Flash的三分之一。
同一天,智谱的GLM-5.3-Flash也挂上开源榜,3200亿总参数、激活180亿。
那两周,行业喊的是“成本革命”:模型竞赛的胜负手,比的是谁更省、谁更快、谁能在高频调用里把单位成本压到最低。
一个月后,云栖又把“大”字推回C位,两种打法开始共存。
从模型本身来看,Flash这类模型,优化的是“高频、实时、成本敏感”的场景,用户要的是又快又便宜,所以把激活参数压到极小。
而大参数模型,优化的则是最难、最杂、要覆盖最广的场景,要的是最硬的推理、最长的Agent链路、最广的能力覆盖。
让这两种打法能共存、甚至能来回切换的,是MoE架构(Mixture of Experts,混合专家架构),把模型拆成众多“专家”,每次推理只唤醒其中一部分。它最核心的贡献,是把总参数和实际调用参数彻底解耦,总参数可以继续膨胀,撑住能力上限;单次计算量却被按住,不随总规模同比变重。
对大模型厂商而言,MoE撬动的是成本结构本身:训练成本可控,推理按激活参数计费,等于用同一套底座,同时押注小而快与大而强两条路线。
Flash与大参数最终都在回答同一个问题,怎么让每一分钱,产出更多的智能。
不过,大参数尚且是个期许,10万亿还只是PPT上的数字。现役国产旗舰的顶点,仍是2.8万亿,等模型真落地,牌桌可能已经洗过一轮。那时10万亿不再是终点,而是新的起跑线。
本文来自微信公众号 “Tech星球”(ID:tech618),作者:任雪芸,36氪经授权发布。