中国的大模型双雄,智谱(02513.HK)和MiniMax(00100.HK)正在经历新一轮的收入结构变化,相比此前对外展示的追求AGI技术叙事,两家公司更激进的动作其实只有一个:
学会如何卖Token。
智谱在9月2日入驻天猫开设官方旗舰店,开始在线销售GLM Coding Plan订阅套餐等产品,而MiniMax上半年的B端收入暴增703.1%,占比提升到63.4%,超过C端成为收入的第一大来源。

一位大模型猎头告诉「硅基研究室」,随着to B商业化加速,两家都在招聘to B Token销售,国内国外都需要,对候选人的基本要求是3年以上的云厂商或MaaS平台销售经验:“最好还自己要会vide coding”。
卖Token并不是新鲜事。阿里云和火山引擎都为提升Token规模,制定了激进的「开发客户+高额补贴」动作,但它们激进的前提不止是有模型,而是有底层算力、云厂商资源和大量to B经验。
梳理智谱和MiniMax的「Token卖法」,我们发现两家模型厂商的打法都只是新瓶装旧酒。
正努力学习卖Token的它们,也逐渐意识到这不是一门互联网时代的流量生意,不仅要靠持续领先的SOTA模型,还需要延伸到全链路的Token服务,包括了成本定价、网络稳定、安全合规等更复杂的竞争因素。
01 大模型双雄,怎么卖Token?
卖Token,不是一件新鲜事,智谱和MiniMax无论是在强调Token消耗规模、Token智能密度,抑或是优化Token架构,但本质上,卖Token就对应三类生意模式。
第一种是,是卖调用量,按量计费,也就是把Token当水电煤卖。
早在大模型兴起初期,云厂商和模型厂商就已跑通了这种模式,通过MaaS平台为企业提供开箱即用的API调用服务。
智谱的收入重心也转向了卖API。2025上半年,本地化部署占据智谱八成以上营收,但现在开放平台及API的收入占比已取代这一业务,API生意占据整体营收86.5%。
MiniMax也是一样,今年上半年,其开放平台及AI企业服务收入占比已超六成,而此前C端订阅收费是MiniMax的收入主力。

第二种是,卖订阅,按积分额度付费,把Token当话费卖。
分档位、限额度,分层收费,把Token打包成套餐,本质还是订阅付费,年初随着龙虾热和编程应用兴起,模型厂商端出了各种Token付费套餐,比如智谱的Coding Plan、MiniMax的Token Plan等。
第三种,卖标品,把API打包给下游的中转站或AI应用公司,模型公司做幕后的批发商。
这之中,AI应用公司或中转站也会争夺模型厂商API首发权,签订年框订单,价格不同、模型能力和体验也不同。
智谱和MiniMax卖Token的方法,基本涵盖了这三种,但也有差异。
首先,战场不同。
智谱主要聚焦国外市场,而MiniMax更强调全球化生意。今年上半年,MiniMax海外收入占总收入的比例已达到了60.8%。
其次,场景不同。
智谱的Token套餐更强调Coding能力和网络安全能力,而MiniMax的Token Plan更强调的是全模态能力,这也和两大模型厂商的业务场景和模型能力有关。

智谱管理层在业绩电话会上将大模型能力的演进形容为「一条只能按顺序走完的阶梯」:分为Chat、Coding、Agent、Co-worker、Autonomous AI五大阶段,目前公司处于第二级的Coding到第四级Co-work之间。
可以看出,智谱是明显的「阶梯式卖Token」路线。
代表高阶智能的GLM-5.2、GLM-5.3里强调了Coding的长程任务和网络安全能力,而GLM-5.3 Flash则作为性价比模型,聚焦低价Token的普惠。
显然,智谱更看重Token交付结果,不同任务难度交付不同的Token价值,因此必须分层、分任务定价。
和智谱不同,MiniMax则是��一体化卖Token」路线。
MiniMax同样押注Coding、Agentic能力,比如今年6月推出的MiniMax-M3。但除此以外,MiniMax还押注了多模态模型,视频、音频等原生多模态能力的进化是MiniMax的另一张王牌。
正因如此,MiniMax采取的是文本模型和多模态模型多线并进,通过模应一体化来卖Token,文本模型用来承接代码场景,多模态模型则聚焦创作和内容生产场景。
02 卖Token这场仗,不得不打
疯狂卖Token,也是「大模型双雄」不得不打的一张仗。
尽管双方在今年都默契提出了关于Token的公式,对「卖Token」这件事很有信心。智谱认为,AGI商业价值=智能上界×Token消耗规模,MiniMax则认为,平台价值=智能密度×Token吞吐量。
但一位算力销售告诉「硅基研究室」,真正要用Token的客户是「僧多粥少」:“很多数据看着漂亮,但客户对价格依旧敏感,很多来询价的最后要么是问渠道合作,要么是薅Token额度。”
这意味着,争夺有付费意愿的企业客户、落地能交付Token价值的场景,成了一件「先到先得」的事。
除此以外,云厂商和运营商也在争夺Token市场。阿里今年4月制定了一项旨在提升Token规模的「530 Token战役」,电信、移动和联通三大运营商也开始卖Token套餐。
和这些竞争对手相比,大模型双雄的劣势很明显:缺算力、缺服务。
一方面,云厂商和运营商都建设了庞大的算力网络,能够以规模优势降低Token成本。
另一方面,多年的渠道和服务资源,也让他们有强势的业务触点能接触和理解一线企业的Token服务需求。
但对智谱和MiniMax来说,攻克企业端市场,它们也有两项能力优势。
第一是,Token定价权。
卖Token本身并不难,难的是Token的长期定价权。
今天的模型竞争,已不是单点SOTA模型的领先,也不是某个benchmark上的第一,Token定价权建立在「快、好、省」三个字上。
• 快:模型迭代速度能否追平前沿模型,保持SOTA领先。
• 好:在真实的任务里,模型和应用的完成率是否抵达用户预期,在更高价值的任务场景,模型是否能实现高效交付。
• 省:进入真实工作流里,需要考虑模型的稳定性以及用户迁移和适配的成本。
智谱和MiniMax也意识到这一点。智谱管理层在业绩电话会上也提到,Token定价权建立在更快的模型迭代、更高的真实任务完成率、更低的单位智能成本,以及进入更高价值的工作流。
如果用户能持续选择自己的模型,就能持续掌握Token的定价权。
第二是,单位智能成本的管控能力。
关键的环节就是优化大模型推理,因为这直接影响吞吐、时延和单位调用成本。为了更高性价比的推理,大模型双雄也有自建基础设施、模型架构创新、调度提升等诸多尝试。
智谱提到,当前已实现十万卡级国产芯片的规模化低成本推理,单位Token推理成本较年初下降80%。
MiniMax创始人兼CEO闫俊杰也透露,随着资金规模扩大,公司已从过去向云厂商采购算力,转向更直接地理解和参与供应链,为配套集群,还将自行建设高速网络、专线、服务器和存储。
除此以外,双方也加快适配国产芯片。管理层提到,目前已经开始使用一部分国产芯片,预计2026年第四季度使用占比会提高。
高性价比的推理是一项全链路的系统化工程,包括并行执行、算子与通信、KV Cache、量化、调度及弹性服务等多方面,这是技术算账逻辑,而对先上市的智谱和MiniMax,学会算账早已是它们的必修课。
但掌握Token定价权和单位智能的成本管控,都是一项长期能力建设,智谱和MiniMax短期的领先,并不意味着长期的领跑,尽管双方已经公布了卖Token的战报。
MiniMax提到8月ARR超过8亿美元,Token消耗是1月的20倍,而智谱8月ARR达到16亿美元,较一个月前增长60%。

但需要注意的是,ARR只反映了某一节点模型厂商的收入情况,它并不能和直接确认的财务收入划等号,也无法反映真实的利润结构。
因此,仅从当下来看,对大模型双雄来说,卖Token依旧不能视作一门稳赚不赔的好生意。
一方面,它逐渐趋向重资产,需要厂商有渠道资源、有一线客户需求;另一方面,它的毛利率天花板也不完全取决于模型多聪明,而是取决于模型和算力带来的综合成本优势。
对智谱和MiniMax来说,卖Token这场仗,不得不打,也更加艰难。
本文来自微信公众号“硅基研究室”,作者:kiki,36氪经授权发布。