模型能力越快迭代,Token价格越往下走。
9月10日,DeepSeek发布V4.1 Flash,并再次下调Flash系列API价格。
非高峰时段,每百万Token的缓存命中输入价格降至0.02元,未命中输入降至1元,输出降至4元;高峰时段价格为其两倍。
官方宣布,新模型在性能、费用、速度和总用时等方面全面超过V4 Pro,并计划在9月14日之后,将部分Pro请求转至Flash。
这改变了模型行业的定价规则:过去,模型能力提升支撑更高价格;现在,能力提升可能成为降价的理由。
同一天,智谱收跌10.34%,MiniMax收跌8.98%。截至9月11日收盘,9月以来两家公司股价累计跌幅分别达到33.64%和22.98%。
智谱2026年上半年收入9.54亿元,同比增长399.7%,超过2025年全年。MiniMax同期收入1.17亿美元,同比增长283.1%,同样超过去年全年。
业绩会上,两家公司又把增长速度推高了一截。智谱披露8月ARR约为16亿美元,MiniMax披露8月ARR超过8亿美元。
三天前,华尔街知名投行杰富瑞也将智谱2026年至2029年的收入预测上调37%至119%,同时下调了亏损预测。
按照通常逻辑,一家公司未来收入更多,亏损更少,估值也应该随之提高。
但杰富瑞却将智谱目标价由1299.8港元下调至1183.79港元,把智谱开放平台及API业务的估值标准,从预计2026年ARR的50倍降到30倍。
按同样一元ARR计算,过去估值50元,现在只给30元。
扛不住波动的ARR估值
智谱2026年上半年收入9.54亿元,同比增长399.7%,超过2025年全年收入;但同期亏损仍达到20.72亿元。
智谱的收入结构也发生了明显变化。开放平台及API业务上半年收入8.25亿元,同比增长2735.7%,占总收入的86.5%,取代本地化部署成为公司的主要收入来源。
MiniMax的情况类似。
公司上半年收入1.166亿美元,同比增长283.1%,超过2025年全年收入。其中,开放平台及其他AI企业服务收入7390万美元,同比增长703.1%,占总收入的63.4%。但公司同期经调整净亏损达到2.93亿美元,毛利率只有17.9%。
两家公司都在从一次性交付、定制项目和AI原生产品,转向更加依赖API调用和企业服务。
这条路的好处是收入增长更快,也更容易形成规模效应。
代价是,收入会直接暴露在Token价格变化之下。价格下降之后,调用量必须以更快速度增长,才能抵消单价下跌。
智谱管理层在半年报后的业绩交流会上透露,8月ARR约为16亿美元。MiniMax也披露,8月ARR超过8亿美元。
ARR是模型公司现在最受关注的指标。
它把最近一个月的收入按照当前速度年化,能够快速反映业务是否正在加速。但它只是大模型变现的加速度表,半年报收入则更像里程表。
前者可以告诉市场,公司最近跑得有多快;后者才说明公司已经跑了多远。
只要价格、客户结构或调用量发生变化,ARR就可能迅速波动。
这也是智谱财报之后,市场出现分歧的原因。
乐观者看到的是,API调用量快速增长,平台正在形成新的收入曲线;谨慎者在意调用能持续多久,价格下降之后还能留下多少收入,ARR何时能够稳定转化为财务报表上的收入。
高增长没有消失,但增长质量成为关注重点。
据杰富瑞测算,智谱两家主要客户分别贡献超过2.5亿美元ARR,合计至少占31%。其中任何一家减少调用,都会直接改变按当月收入推算的年化ARR规模。
就在DeepSeek调价前几天,媒体援引杰富瑞报告称,该行将智谱2026年至2029年的收入预测上调37%至119%,同时下调亏损预测。
但在同一份报告中,杰富瑞将智谱目标价从1299.8港元下调至1183.79港元,并把开放平台及API业务的估值倍数从预期2026年ARR的50倍下调至30倍。
收入预测上调,目标价却下调,看起来矛盾,实际上反映了市场正在改变估值方法。
此前,资本市场愿意为模型公司的高速增长支付更高倍数。只要ARR增长足够快,价格本身不是最重要的问题。
现在,市场开始怀疑这些收入是不是还值得原来的价格。
从50倍ARR降到30倍,相当于估值倍数下调了40%。在其他条件不变的情况下,公司需要把ARR再提高约67%,才能抵消估值倍数下降的影响。
Token的定价权在谁手里?
智谱目前确实拥有一定的定价权。
2026年一季度,公司将API调用价格提高83%,调用量仍增长400%。这构成了智谱中报中最强的一组商业化数据。
GLM进入代码开发和智能体等更复杂的任务后,客户愿意为更高的模型能力支付更多费用。
业绩会上公司还披露,截至8月31日,智谱MaaS平台Token调用量较年初增长超过40倍,API平均售价提高约101%,付费日活用户增长603%。
但智谱整个平台在一段时间内量价齐升,而不是GLM-5.2一款模型提价一倍后,销量增长40倍。
GLM-5.2于6月15日发布,此后两个多月,智谱又推出GLM-5.3和GLM-5.3-Flash。
据智谱介绍,GLM-5.3-Flash模型拥有320B总参数,每次推理只激活18B参数。其能力超过GLM-5.2,API价格却只有GLM-5.3的十分之一。
中报收入统计截至6月30日,40倍Token调用量和603%的付费日活增幅却统计到了8月31日。
GLM-5.3-Flash上线的同一天,阿里上线Qwen3.8-Flash。随后半个月,腾讯和DeepSeek也相继推出轻量、高吞吐模型。
几家公司争夺的不是一个低价产品档位,而是最容易形成海量调用的API市场。
代码开发、办公智能体等高频任务,并不需要每一次都使用价格最高的旗舰模型。速度更快、价格更低、能力足够的Flash,反而更适合承接大规模调用。
目前,三款模型的普通输入和输出价格已经相差不大,拉开差距的是缓存输入。
所谓缓存输入,是指模型再次读取已经处理过的系统指令、历史对话或者代码库。以DeepSeek非高峰价格计算,首次处理100万Token收费1元,再次读取相同内容只收0.02元。
对模型公司而言,两次读取都产生了Token使用量,带来的收入却相差50倍。这意味着,如果大量调用来自低价Flash和缓存内容,API收入未必按照同样速度增长。

昨天还只有旗舰模型能完成的任务,今天已经被Flash压到低价区。模型刚刚建立的能力溢价,很快就成了全行业的公开报价。
这让智谱的“Token增长40倍”有了另一种解释。
未来,客户即使没有离开智谱,只是从GLM-5.3换到价格只有十分之一的Flash,同样数量的Token也只能换来更少的收入。
更何况,竞争对手也在提供低价替代。模型API的接口又相对标准,这些选择之间的技术边界已经越来越低。
智谱、MiniMax、DeepSeek和阿里云均提供OpenAI兼容接口。开发者更换API密钥和基础地址,再重新测试准确率、速度和稳定性,就可以迁移模型,不需要重建整套应用。
因此,智谱接下来必须同时跑赢两场比赛。调用量增长要快过单价下降,推理成本下降还要快过报价下降。只要其中一项掉队,每一元ARR留下的毛利就会变少。
智谱们的独立模型厂难做
智谱与MiniMax曾经代表两条完全不同的大模型商业化路线。
智谱从清华技术背景和政企客户起步,依靠本地化部署进入政府、金融和能源行业。MiniMax则以Talkie、海螺AI等产品触达全球消费者,收入主要来自订阅和应用内付费。
2025年,智谱73.7%的收入来自本地化部署,MiniMax约67%的收入来自AI原生产品。
到了2026年上半年,智谱开放平台及API收入占比已经达到86.5%。MiniMax开放平台及其他AI企业服务收入占比也从30.3%升至63.4%,首次超过AI原生产品。管理层披露,B端业务已贡献约80%的ARR。
两家公司最快的增长,都不再来自原来的优势业务,而是企业和开发者消耗的Token。
而当两家公司都被归入Token供应商,一家的估值折价就会成为另一家的参照。
Kimi K3发布后,摩根大通将智谱和MiniMax的长期估值倍数由30倍降至20倍。
9月,杰富瑞又把智谱API业务的ARR倍数由50倍降至30倍。即使上调收入预测的华泰证券,也把智谱2029年市销率由27倍降至20倍。
估值倍数的连续下调,正是在缩短市场愿意预付的时间。
智谱上市时的高估值,至少包含三重期待。
它是港股稀缺的纯大模型标的,也是海外模型受限时的国产替代选择。GLM-5.2进入代码和智能体等高价值任务后,智谱涨价仍能增加调用,又让市场看到单代模型领先带来的定价权。
半年后,这三重期待都不再稀缺。
更多独立模型公司传出上市计划,投资者不再只有智谱和MiniMax两个入口。DeepSeek、Kimi、千问、腾讯和MiniMax也都能满足部分国产模型需求。国产替代仍然成立,却不再专属于智谱。
新一轮Flash价格战把最后一层溢价也压短了。一款模型的领先可能只维持几个月,甚至更短。产品优势越来越难直接换算成未来数年的定价权。
模型行业的增长正在变得更便宜。
过去,模型公司可以用更强的能力获得更高价格;现在,技术进步和价格下降同时发生。能力差距缩小之后,客户会更容易在不同模型之间切换,API价格也会成为采购决策的重要因素。
这对独立模型公司尤其重要。
大厂拥有算力、云平台和分发渠道,可以把模型当作生态的一部分。独立模型公司则必须证明,自己不仅能把模型做出来,还能在价格持续下降的环境中,保住客户、扩大调用量,并且改善利润率。
智谱和MiniMax的高增长并没有结束,但资本市场已经不再只为增长本身付费。
本文来自微信公众号“数智奔流”,作者:熵野,编辑:沈校,36氪经授权发布。