首页 > 资讯 > 从流量到Token,算网基础设施正由AI原生“再定义”甲子光年智库

从流量到Token,算网基础设施正由AI原生“再定义”甲子光年智库

甲子光年 2026-09-30 06:04 7 阅读 查看原文

Token逻辑兴起,算网基础设施从规模扩张走向更深层的效率协同。


作者|黄琪丹


想象这样一个下午。


距离交报告还有两个小时。你把一堆资料交给Agent,让它核对数据、补充信息,再整理成一份报告。为了这项工作,你已经订阅了最强的一档模型。


Agent很快理解了要求,列出计划,开始执行。几分钟后,屏幕上出现了第一批结果:资料已经分类,报告也有了大致结构。照这个速度,你甚至觉得今天可以提前下班。


但接下来,进度慢了下来。


一些查询仍在进行,一次工具调用失败后重新尝试,新生成的内容停在了半句话。你检查网络,切换页面,又回来看了一眼。界面还显示“正在处理”,却没有告诉你,距离完成还有多久。


时间一点点过去。你开始犹豫:继续等,还是自己接手?


模型可能仍在推理,也可能正在等待资料、工具或计算资源。但对于屏幕前的人而言,这些原因暂时没有区别。你已经买到了很强的模型能力,但今天的工作能否按时完成,仍然没有把握。


聊天时,一次回答不够好,可以继续追问;进入工作流程以后,任务会有截止时间,有必须读取的数据,有需要连接的业务系统,还可能有等待它完成才能开始的下一项工作。


任务结果依赖于一段能够顺利走完的执行过程,而这段过程发生在用户看不见的地方。于是,一个问题逐渐浮现:我们准备好让Agent持续、可靠地运行了吗?


2026年9月8日至9日,在吉隆坡举行的中兴通讯全球峰会上,中兴通讯对这一问题给出了回应。会议主要围绕网络与计算展开讨论,并指向一个清晰的判断:要让Agent持续、可靠地进入实际工作,基础设施的建设逻辑需要从规模(Scale)转向效率(Efficiency)。




1.背景:基础设施正处于转型的时代拐点


  移动互联网的遗留问题:流量增量不增收,溢价空间收窄


通信行业正在经历一次典型的增长模式转换。


从流量侧看,流量消费仍在保持较强增长。


工信部数据显示,2021—2025年,全国移动互联网接入流量由2,216亿GB增长至3,958亿GB,四年增长约79%。从增速看,移动互联网流量在保持两位数增长的同时呈现先放缓、后回升态势,同比增速由2021年的33.9%逐步降至2024年的11.6%,2025年重新回升至17.3%,流量消费增长动能有所增强。



以国内Tier1运营商数据为例,中国移动年报显示,手机用户平均月流量(DOU)从2021年的12.6GB/户/月增长至2025年的17.3GB/户/月。尽管2024年DOU同比增速一度归零,但2025年反弹至9.0%,表明用户的流量消费仍有回弹上升趋势。



但从收入侧看,增长并未同步到来。


工信部数据显示,2021—2025年,国内移动数据流量业务收入由6,381亿元降至6,097亿元,与同期移动互联网接入流量近八成的增长形成明显反差。同期业务收入同比增速由3.3%降至-3.1%,并自2023年起连续三年负增长,流量增长并未带来相应的收入增长。



用户价值的收缩更为直接。以国内Tier1运营商数据为例,中国移动年报数据显示,2021—2025年每用户平均收入(ARPU)从48.8元/户/月上升至2023年的49.3元/户/月高点后,于2024—2025年连续两年下行,2025年降至46.8元/户/月,同比下降3.5%。这与同期DOU持续增长形成鲜明对比,进一步说明流量增长未能有效转化为用户价值提升。



流量规模扩张与收入下滑形成了明显的“剪刀差”,构成了典型的“增量不增收”困局。依靠流量增长拉动收入的传统模式正在触及天花板——比特时代已经从高速增长期,进入了存量竞争的成熟期。


理解这道“剪刀差”,不妨回到用户的手机账单。


3G转向4G时期,流量是要精打细算的。刷视频前先找Wi-Fi,月底看套餐余量,超了可能要硬撑到下月。


5G时代的今天,流量已经像水电一样平常。用户可以看更多视频、使用更多应用,却不一定需要增加通信支出。在包月套餐里,多消耗一个GB,并不意味着运营商能多收一笔钱。


当现有套餐足以满足日常需求,额外的流量就未必有吸引力。如果用户感受不到明显的体验差异,更低的价格、更大的流量包,反而容易成为运营商争夺用户的手段,最后挤压到单位流量的收入空间。


用户通过网络看视频、玩游戏、购物,产生的广告、会员和交易收入,大概率流入互联网公司,并不会自动进入运营商的账单。网络承载的商业活动越来越丰富,运营商却需要另找途径参与其中的价值创造。


可是连接的重要性并没有下降,它越是成为习以为常的基础服务,就越难仅凭数量获得溢价。网络需要回答的问题,已经从如何提供更多连接,转向如何让连接带来更值得付费的新体验。


  新需求:Token消耗爆发式增长,算网迎来新负荷


当更多流量难以直接带来更多收入,新的需求正在浮现:Agent正在成为新的资源消耗主体。


一句指令,背后可能是一连串操作:搜索资料、读取文档、调用模型推理、访问外部工具,再检查和修改结果。与单轮问答相比,长程任务不仅增加了模型调用次数,还可能将历史记录、工具返回的数据和中间结果不断纳入后续输入,推高Token消耗。


调用规模的增长已经显现。国家数据局监测的最新数据显示,我国日均词元调用量在2024年初约为0.1万亿,2026年6月激增至近175万亿,增速远超移动互联网流量的增长水平,同时我国也成为了词元调用量最大的国家。



IDC预测,全球Token年消耗量将从2025年的0.0005PetaTokens跃升至2030年的152,667PetaTokens,年复合增长率达3,418%(1PetaToken相当于1,000万亿个Token)。



大量Token消耗,首先会直接转化为算力基础设施的推理负载。原因在于,模型每读一段材料、每写一段回答,背后都需要计算。输入Token越多,模型需要读的内容就越长;输出Token越多,模型需要一步步生成的内容就越多。Token用量上升,算力基础设施要完成的工作也在增加。


Agent又进一步放大了这种需求。为了完成一项任务,Agent向前每走一步,都可能再次调用模型,带上此前的记录和新获取的信息。用户只提了一个要求,后台却可能忙了很多轮。


对“Token工厂”来说,这相当于订单增加了,每张订单的加工工序也变多了。如果还要保持原来的交付速度,就需要提高生产效率。


除了算力以外,Token需求也会延伸到网络。Agent的上下文累积越厚,单次请求的数据包就越大;而多轮调用又意味着这种大流量传输的频次在增加。对网络而言,这不仅是“传得更多”的问题,也是“传得更频繁、更及时”的问题。


不同类型的Agent,对网络的诉求也各有侧重。任务型Agent涉及多轮数据传输与工具调用,更关注有效吞吐和连接可靠性,大文件上传时还需要充足的上行带宽;实时型Agent依赖连续的多模态交互,对端到端时延、抖动和丢包率更敏感;具身型Agent需要维持感知、决策与行动闭环,对时延上限和传输可靠性要求更严格。Token驱动的增长,也推动网络保障从带宽总量走向吞吐、时延与可靠性的综合优化。


不同类型Agent对网络的诉求,图片来源:2026中兴通讯全球峰会分析师专场会议现场PPT


  发展拐点:规模之外,算网更需回应任务效率


一边是流量持续增长,却难以换来收入同步提升;另一边是Agent开始承担工作,推动Token消耗快速攀升。两条曲线背后,是基础设施正在迎来的一次重心转移。


过去几十年,扩大供给是网络与算力发展的主线。网络不断拓展覆盖、提升带宽,算力则持续追求芯片性能与集群规模。2023-2024年,“百模大战”兴起,模型训练需要大规模算力,又进一步强化了行业对规模的关注。


现在,这些投入的标准正在发生变化。


在网络侧,流量增长与收入增长之间的脱节,正在推动行业重新寻找连接的溢价。在算力侧,Agent应用覆盖面逐渐扩大,推理正在成为产业竞争的新重心。规模决定能力的上限,效率则影响这些能力能否被广泛、持续地使用。


基础设施的转型,正在从规模的积累,走向更加侧重效率。这场转型已经展开,但它需要跨越的障碍,才刚刚显现。




2.重难点:从规模到效率,中间隔着什么?


  网络侧:Agent接入后,网络系统多重承压


Agent时代,网络面对的变化发生在四个层面:连接对象是谁、数据如何流动、任务需要怎样的体验保障、网络需要怎样的运维。


第一,连接对象从人拓展到Agent,网络接入与并发承载压力上升。 


移动互联网的网络设计,主要围绕人的使用行为展开。当连接对象拓展到Agent,网络还要支撑Agent之间、Agent与各类外部服务之间的互联。即使用户离开屏幕,后台任务仍可能持续运行,并根据任务需要调用其他Agent。单个任务由此可能带来多路并发请求,多任务叠加则进一步增加连接数量与交互频次,对网络的并发承载能力和突发流量处理能力提出更高要求。


第二,流量结构发生变化,上行与东西向通信成为新的承载压力点。


移动互联网的典型场景,是用户从平台获取内容。刷视频、浏览网页,大量数据从服务器流向终端,网络资源配置按照“下行粗、上行细”的非对称模式建设。Agent参与工作后,变化发生在两方面:一是Agent需要持续上传感知数据、环境状态和任务执行结果,推动终端与云端的上下行流量趋于对称;二是Agent之间以及Agent与模型、数据库、工具之间需要频繁调用,产生大量服务器之间的东西向通信。资源配置与流量分布的错配成了一个结构性问题:下行容量尚有余量,上行却可能成为瓶颈;骨干链路容量充足,数据中心内部的交换仍可能拥塞。


第三,网络体验要求提高,保障压力从单次交互延伸至任务全链路。


在Agent任务的连续执行过程中,前一步的输出往往是后续步骤的输入,局部网络波动可能拖慢整条任务链路。单步超时会导致后续步骤等待,重传则可能增加传输开销,并触发额外的计算与调用。对于实时交互及具身应用,时延超过阈值还可能影响任务有效性。这要求网络在连续交互中同时控制时延、抖动与丢包,并在异常发生后及时恢复。平均指标达标,已不足以说明任务能够顺利完成,全链路的稳定性与确定性成为更难满足的保障要求。


第四,上述三重变化叠加,也抬高了网络运维的难度。


传统网络运维与安全管理,主要依靠指标监控、边界防护和人工处置这“三板斧”。Agent接入网络以后,这套体系难以看清Agent的完整行为路径,而且AI驱动的攻击更快、更隐蔽,传统的告警阈值和规则库很难及时识别。问题还没解决,规模又上来了。Agent接得越多、交互越频繁,需要关联分析的告警和状态信息就越多,而留给运维人员的处置窗口却在缩小。碎片化告警叠加被动排查,人工运维的效能天花板已经显现。


  计算侧:芯片成规模后,算力系统的效率瓶颈


计算侧的效率损耗,往往从芯片之外开始。


在需要多卡、多机协同的推理任务中,计算单元必须不断读取数据、交换中间结果。长上下文带来的缓存需求,以及复杂模型运行中的跨卡通信,都可能增加数据流动的压力。如果数据供给跟不上处理速度,芯片即使拥有很高的峰值算力,也只能等待。


这也是互联成为算力基础设施关键问题的原因。更多芯片接入集群,增加了计算能力,也增加了通信关系。连接路径、交换带宽与传输时延,都会影响这些芯片能否高效协作。集群规模扩大之后,数据搬运中的损耗,可能抵消一部分新增算力带来的收益。


数据能送到,还只是第一步。


Agent每次调用模型的请求并不相同。读长文、生成内容、即时响应、延后处理等等,这些请求占用的算力、显存和处理时间各不相同,系统需要结合请求特点与节点负载进行分配。如果调度跟不上请求的变化,就可能出现部分节点排起长队、其他节点仍有余力的情况,让已有算力难以充分发挥作用。


网络与算力状态之间缺乏协同,会进一步放大资源错配。


一个节点虽然有空闲算力,但通往它的链路可能已经拥塞;一条链路畅通,也不等于计算节点能够立即处理请求。调度需要同时考虑计算资源和数据抵达的代价,才能让请求及时抵达并得到处理,减少“有算力,却用不好”的资源错配。


当推理成为持续运行的服务,系统还要面对更长周期的考验。


从芯片到业务上线,中间还有整机集成、系统软件、模型适配和运行调优。高密度部署带来的供电、散热与维护要求,也会影响算力能否稳定释放。节点故障后能否及时恢复,业务增长时能否平稳扩容,决定了系统能否持续交付,而不只是芯片在一次测试中跑出高分。


这些问题最终都会进入成本账本:等待消耗资源,故障打断服务,适配和维护拉长交付周期。衡量算力效率,需要同时看响应速度、吞吐能力与长期运行成本。




3.中兴通讯的回应:

从连接到算力,参与基础设施的“再定义”


  网络侧:AIR Solution移动网络智能化解决方案,推动网络系统升级


面对新变化,中兴通讯在网络侧的回应集中体现在AIR Solution移动网络智能化解决方案中,该方案架构具体可拆解为三层:平台层、原子能力层、Agent层。


平台层作为底座向上输出,一方面通过底层引擎提供通用智能,另一方面封装好组件提供能力服务接口。在通用引擎层面,数据引擎汇聚网络全域数据,AI或ML引擎提供模型训练与推理能力,数字孪生引擎构建网络的虚拟映射。在引擎之上,通过数据组件、服务组件、孪生组件、大模型组件和API编排组件,把底层能力封装成可调用的服务接口。


在平台层之上,可复用的能力被拆解为“原子能力”,按网络域分类沉淀,构成原子能力层。例如,无线接入网侧涵盖故障监测、覆盖优化、容量优化等能力;核心网侧聚焦业务感知与质量监测;承载网侧处理链路故障与客户投诉。


Agent层,区分为Copilot(助手型)与Expert(专家型),前者处理相对标准化、高频的运维任务,如RAN故障告警、值班问答、网络洞察,后者处理复杂、跨域、需要深度分析的任务,如跨域故障定位、客户投诉根因分析、节能策略制定。


AIR Solution方案包含AIR RAN、AIR Net、AIR Core三部分。其中,AIR RAN面向无线接入网,通过站点与网络服务的智能化升级,提升网络效率与业务体验;AIR Net主要面向网络运维,推动数智员工协作与高阶自智;AIR Core面向核心网,构建Agent原生网络架构。三者共同构成中兴通讯从连接能力到网络运行方式的系统性升级。


  • 体验升级:AIR RAN,从Best-Effort到确定性体验保障


在无线接入侧,中兴通讯通过AIR RAN创新解决方案,推进站点与网络服务的智能化升级,为本地AI推理与实时决策提供支持,为运营商提供大上行、确定性保障以及广覆盖能力,让无线网络能够更灵活地响应业务需求。


9月9日,在分析师专场会议中,中兴通讯展示了增强上行、确定性体验和体验连续性等方向的技术进展,推动网络服务从“尽力而为”(Best-Effort)向“确定性体验保障”升级。


针对上行流量增长,MaxUP解决方法解锁广泛覆盖的增强上行,利用全频段FDD和TDD M-MIMO,包括U6G和智能多载波协调;针对确定性体验升级,在设备、网络、应用协同演进的驱动下,ExperienceTurbo通过“以用户和应用为中心”的体验优化与AI体验MOS的多模态编排,提供细粒度、确定性的体验;针对连续性体验保障升级,GigaMIMO进一步增强以用户为中心的体验一致性,从小区中心到小区边缘实现零变化的移动体验。


  • 运维升级:AIR Net,让数智人成为L4+自智网络的新生产力


在运维侧,中兴通讯推出AIR Net高阶自智网络方案,引入并持续迭代大模型及Agent技术能力,助力运营商网络迈向L4及以上级别的高阶。


该方案采用全栈AI架构设计,从三个层面构建能力。


在硬件层,将传统智能网元升级为具备内生智能的原生智能网元,夯实实时感知与远程控制能力;在网络层,以硬件层能力为基础,打造“实时感知—自主分析—自主决策—自动执行”的智能闭环,实现去工单化的端到端运维;在业务层,依托Agent工厂快速组装并生产工业级通信数智人,支持面向目标的任务自主规划,结合单域自智与跨域协同能力,拓展并加速故障处理、网络优化、用户投诉等高价值场景落地。


技术支撑上,该方案采用“1+N”模型矩阵。


通用大语言模型承载复杂推理任务,轻量化结构化模型适配异常信令分析、趋势预测等简单场景,有效破解单一模型“理解准但响应慢”与“响应快但理解浅”的固有矛盾,保障生产场景下的决策精度与响应效率,降低大模型幻觉。同时,所生产的Agent具备自进化能力,针对知识易老化、适配不灵活、能力天花板低等挑战,通过实时Badcase库、静态RAG知识、Skill调用及Agent闭环测评等机制拓展能力边界,实现工具与知识双进化,打造越用越强的Agent。


目前,中兴通讯已实现单场景L4能力的快速复制与单域自智成效的领先突破,并在跨域复杂场景中助力运营商达成更优的网络质量与用户体验,实现运维提效与成本优化。


中兴通讯AIR Net解决方案,图片来源:中兴通讯《2026自智网络白皮书》


  • 架构升级:AIR Core,面向Agent的下一代核心网络


在架构侧,中兴通讯推出AI原生核心网AIR Core,该方案通过深度集成大语言模型、通讯大模型、数字孪生等前沿AI技术,推动核心网从“Cloud Native”向“AI Native”的架构级跃迁。


从能力布局看,AIR Core将AI赋能到通信网络的四个方向:数据流量的优质体验变现、语音业务的服务入口重塑、网络效率与可靠性提升,以及网络运维从L3向L4+的演进。


在架构层面,AIR Core向上通过API、A2A、A2A-T、MCP等接口连接各类终端并实现Agent之间的通讯,向下以AI原生核心融合网络、计算、数据与安全等能力,底层形成“感知—思考—决策—行动”的闭环使能器。


在执行层面,AIR Core强调五大自智能力。预测与预防能力,在用户受影响前预判并处置风险;自优化能力,根据负载与业务变化动态调整资源与策略;自愈能力,自主完成故障的检测、定位和修复;自进化能力,从运行经验中学习并持续优化策略与模型;跨域编排能力,打通网络、云与IT,实现端到端协同处置。


  计算侧:以超节点组织算力,让每一个Token更高效


面对互联、调度与持续运行的多重考验,中兴通讯以OEX超节点提升算力密度,并通过开放接口与统一工程规范,为用户提供多样化的产品方案选择。


  • SuperPOD OEX超节点方案


Token消耗的快速增长,对算力基础设施提出了双重要求:既要扩大供给,也要提高单位算力的产出效率。当多卡协作成为常态,单卡性能就难以独自决定系统效率。算力增长的关键,不只在于“堆卡”,更在于“如何组织卡”。


中兴通讯OEX超节点以系统协同回应这一需求,通过高密度硬件集成、软硬件优化与弹性扩展,将分散的加速卡组织成高效协作的计算系统。


先从硬件集成与互联说起。


在需要多卡、多机协作的计算中,加速卡之间必须频繁交换数据。互联效率不足,单卡性能就难以充分释放。OEX超节点通过高速互联,将多张加速卡整合为逻辑统一的计算单元,使其像一台“巨型服务器”一样协同工作。


要实现这种协同,首先需要突破高密度部署的工程瓶颈。传统机柜内,高速线缆随卡数增加而增多,信号损耗、布线、散热与检修的压力也随之上升。中兴通讯原创的OEX正交无背板架构,让计算托盘与交换托盘垂直交叉、直接连接,减少高速线缆并缩短信号路径。按照中兴通讯披露,单机柜可实现128卡集成。


这一设计将互联、密度和可维护性放在同一个系统中优化:缩短连接路径,改善高速链路质量;减少线缆,降低布线与故障排查的复杂度,为高密度算力的持续运行提供支撑。


从单机柜走向更大规模的集群,中兴通讯展示的超节点方案通过Scale-up与Scale-out两个层面扩展算力:前者以紧密互联增强单个计算系统的协作能力,后者通过连接更多节点扩大集群规模。根据中兴通讯披露,该方案可支持扩展至10万张GPU,将多卡协作进一步延伸到大规模集群。


中兴通讯OEX架构超节点方案,图片来源:中兴通讯


在硬件集成之上,软硬协同进一步释放推理性能。


模型规模、上下文长度与架构的变化,对计算、存储和通信提出了不同要求。中兴通讯在峰会上提出硬件、软件与模型协同设计,将算子优化、KV Cache管理、全互联通信和PD分离纳入系统优化。


这些措施将超节点的优化范围从物理连接延伸到模型执行过程。算子优化可以提高计算执行效率;围绕HBM、DRAM与SSD组织KV Cache,能够缓解长上下文带来的缓存压力;优化多卡间的数据交换,可以减少等待数据造成的计算停顿;PD分离则为处理输入与逐步生成Token这两个负载特征不同的阶段分别配置资源,让硬件能力更好地匹配推理需求。


  • 算力生态构建


超节点提升系统内部的协作效率,开放生态则为算力的持续演进保留空间。


算力基础设施面临一个持续变化的环境,芯片仍在快速迭代,模型架构快速演进,业务负载的精度与时延要求也各不相同。从芯片选型、系统集成到模型上线,任何一个环节的适配成本,都可能影响算力投入转化为业务能力的速度。算力基础设施需要能够接纳新的芯片、模型架构与不同业务,让客户根据业务选择算力,并为后续升级保留空间。


「甲子光年」了解到,中兴通讯具备芯片、系统、平台与模型四个层面的开放计算生态:芯片层支持多芯与按需选择,系统层通过开放架构支持按需定制,平台层强调多云兼容与按需部署,模型层则支持多模型适配。这四个层面串起了算力从硬件选择到业务应用的过程,让客户能够围绕实际需求组织资源。


OEX的开放接口,是这一生态在硬件层面的具体落点。OEX的机械与电气接口规范,支持第三方计算托盘和交换托盘按照统一标准接入。芯片厂商与系统厂商可以围绕同一物理架构开展适配与集成,减少重复定制和系统改造。开放高速互联协议,进一步衔接GPU机内高速互联和机间无损交换,为多芯协同提供支撑。


中兴通讯OEX超节点支持多芯协同,图片来源:中兴通讯


这种开放还延伸到产品开发与交付。通过前置式开发与统一工程规范,芯片厂商可以减少重复定制与系统改造。中兴通讯将其称为“OEX算力集装箱”模式,希望以标准化接入缩短新芯片从适配到上线的周期。


从高密度互联到开放接口,OEX连接起了超节点建设与芯片生态:前者提高已有算力的协作效率,后者降低新算力接入和持续升级的成本。结果是,已部署的加速卡能被更充分地调度用于推理,同时整个算力池也保留了对新芯片、新资源的弹性接纳能力。




4.下一代基础设施的轮廓:AI原生重构


Agent正在成为基础设施设计与运行的重要依据。


沿着这一变化,下一代基础设施的轮廓正在浮现:


算,支撑Token的规模化与高效生产;

网,承载Agent之间的连接与协作;

存,提供任务所需的知识、数据与上下文;

智,以模型能力支撑推理、分析与决策;

电,为基础设施持续运行提供能源保障。


算、网、存、智在同一条任务链路中相互依赖,电力供给则支撑整条链路的运行。存储管理不当,模型与上下文可能反复加载;网络传递不及时,算力就会空等;计算分配不均,推理请求排队;模型与任务错配,算力资源会被浪费。电力供给保障着计算、网络与存储设备的持续运行,也支撑模型服务的可用性,能源利用效率则影响整条任务链路的运行成本。


AI原生重构包含两个相互联系的方向:一是围绕智能任务,统筹算、网、存、智与电力供给效率,构建面向AI负载的高效基础设施;二是将AI原生作为设计的初始标准,推动所有基础设施以此为准绳进行重新设计与迭代演进,实现从“AI+”到“原生AI”的范式跃迁。




5.结语


回到开头那个等待Agent完成报告的场景,用户发出指令后,期待的是一份按时交付、质量可靠的成果。


基础设施的规模决定能够提供多少资源,效率则影响这些资源能以多快的速度、多低的成本完成任务。


中兴通讯在算网两侧的探索,正是这场产业转型的一个切面。通过AI原生基础设施,让智能能力稳定、持续地进入实际工作,将成为行业需要回答的长期命题。


参考资料:

2026中兴通讯全球峰会会议内容

工信部通信业经济运行情况

中国移动年报

《让每一个Token更高效,中兴通讯以OEX超节点构建开放AI算力底座》,中兴通讯

中兴通讯《2026自智网络白皮书》


(封面图来源:AI生成)





END.