随着AI从回答问题走向执行任务,用户发出一条指令后,智能体需要制定计划、调用工具、检查结果,并根据反馈调整后续步骤。而完成一项任务,可能需要调用模型数十次甚至数百次,对于需要多个智能体协作的复杂任务,整个过程可能持续数小时乃至数天。
这种变化对计算系统提出了新的要求。
9月21日,在2026人工智能计算大会(AICC2026)上,浪潮信息提出,计算产业正在从“提供算力”走向“生产智能”。衡量一套计算系统的价值,除了统计芯片、服务器和存储数量,还需要看它能运行什么样的模型、完成多复杂的任务,以及提供这些服务需要花多少钱。
浪潮信息首席AI战略官刘军将智能体时代的AI计算概括为两个演进方向:能力型智算与容量型智算。会上,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别面向前沿模型运行与大规模推理需求。
刘军表示:“智能体的发展,让智能有望像计算和电力一样,成为可以规模化生产和供给的资源。浪潮信息认为,这意味着人工智能计算既要支撑前沿智能突破能力边界,也要推动智能充分供给,沿着能力型智算与容量型智算两个方向共同发展。能力型智算着眼于智能能够达到的高度,支撑人工智能解决过去解决不了的问题。而智能的价值还取决于有多少人能够获得它,这也是容量型智算的意义:通过效率提升和成本下降,让更多人和企业用得起、用得上。正如稳定、廉价的电力进入千家万户,智能也应从稀缺资源逐步成为整个社会都能获得的基础能力。为此,需要以贯穿式系统创新提升计算效率,以开放创新汇聚产业力量,让智能能力的突破与智能供给的扩大同步推进。”
刘军指出,面向这两类需求,计算系统需要以大模型和智能体负载为牵引,统筹算子、内存、互连与整机系统,从局部优化走向贯穿式系统创新。
刘军举了科学探索的例子:未来,一个AI Scientist可能独立阅读论文、提出假设、设计实验、分析结果,并不断修正判断。这类任务对模型能力要求较高,也需要计算系统长时间支持模型调用、工具交互和数据处理。
其中,时延会直接影响任务进度。一次模型调用只慢一点,在数十次甚至数百次循环中就可能形成明显的等待。如果任务涉及生产故障处置或实时科学观测,处理速度还会影响系统能否及时完成判断。任务持续时间越长,计算、通信和软件的稳定性也越重要。
浪潮信息认为,超节点可以突破传统单机的计算边界,将更多芯片和内存组织到同一个高效协同的计算域中。关键是让模型权重、KV Cache等数据在芯片和内存之间顺畅流动,减少搬移和通信等待。增加芯片数量之后,能否让它们高效配合,决定了新增资源能发挥多少作用。
与此同时,容量型智算更关心同样一笔投入能提供多少智能服务。
按照浪潮信息的分析,推理过程中的不同环节对硬件要求并不相同:Prefill阶段并行度高、计算密集,对算力有更高需求;Decode阶段的Attention计算需要反复读取KV Cache,对显存容量和通信带宽有较高要求;其他稀疏计算也有各自的访存特点。
因此,计算系统需要按任务特点分配资源,再通过软件协调各个环节。哪些任务交给哪类芯片、资源是否闲置、数据传输是否造成等待,都关系到最终的Token产出。对需要持续调用智能体的用户而言,这些效率差异会体现在使用成本上。
据浪潮信息披露,此次发布的元脑SD200 Ultra可单机承载运行2.8万亿参数的Kimi K3模型,Token生成时延低至5.85毫秒,对应单用户生成速度超过170 Tokens/s。
据了解,该产品采用3D Hyper Mesh架构,以开放系统设计紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,支持10万亿参数规模前沿模型单机运行。通过统一寻址和GPU显存直连,系统减少跨芯片访问中转,通信时延低至0.69微秒;短距铜缆互连则用于减少光电转换环节,降低链路故障风险。
据介绍,针对Kimi K3的推理特点,SD200 Ultra还通过计算与通信融合、Tile级流水等超级算子技术,减少算子启动和显存访问开销,使模型推理性能提升3倍以上。
元脑HC2000则采用DirectCom 2.0架构,搭配高密液冷AI整机柜和MCIS推理软件栈,按负载需求匹配、调整资源。在浪潮信息展示的典型智能体任务场景中,部署DeepSeek v4推理服务并保持相同服务水平目标约束时,同等投资Token产能提升10倍。
从能力型智算到容量型智算,刘军所强调的两个方向,最终都涉及智能如何被更多人持续使用。对于企业而言,更强的模型需要转化为能够稳定运行、成本可以承受的服务,才能进入日常工作。算力投入的价值,也需要在这些具体应用中得到检验。(定西)