【TechWeb】9月15日,一份天气预报的计算结果,准时从郑州返回。
中国气象局地球系统数值预报中心研发的MCV模式,在全国产十万卡AI超集群曙光8000上顺利实现异构移植与规模化运行,1小时即可完成全球5公里分辨率、未来10天的预报计算,一举赶超欧美日等国际主流全球业务预报系统。
这项世界级科学应用成果背后,是中国算力交付方式的新一轮蝶变。
天气预报先来敲门
过去,科研人员使用超级计算机,常常得先变成半个系统工程师。
很多时候,代码能不能在一台新的超算上跑起来,本身就是一道极难的门槛。这也是为什么过去很多大集群建好后,都要经历漫长的调试期——因为硬件和应用之间隔着太多的坑。
他们要四处寻找合适的计算中心,确认芯片架构,申请算力资源,再把多年积累的代码一点点迁到陌生的系统上。一旦依赖库、编译环境或并行方式对不上,程序就会直接卡死在门口。换一台机器,前面的痛苦往往还要重新经历一遍。
气象、材料和生命科学团队真正需要的,是一套已经准备好、能够在期限内交卷的计算能力。现在大家追求的“开机即开工”,其实就是想把这道门槛铲平,让科研人员少操心底层的工程杂事,把精力真正放回科学研究本身。
曙光8000正是在这里稳稳拿下了MCV的痛点。
自今年7月上线投用,这套全国产十万卡AI超集群没有让科研团队从零开始熟悉机器,而是把“应用适配”做在了前面——系统上线时,就完成了300余项超智融合重点应用优化,大模型、机器人、新材料等20余个领域的生态基础早已铺好。
这些超前的准备,构成了算力交付前最扎实的底子。研究团队带着模型到来时,工程人员已经清楚程序需要哪类资源、怎样进入系统、哪些环节容易发生堵塞。计算设施不再只提供一批卡,而是把软件环境、迁移经验和运行服务一起打包交到了用户手里。
MCV的顺利运行,让这种全新的交付方式有了国家级任务刻度的证明。外界关注的其实只有两件事:结果靠不靠谱,时间赶不赶得上。
它证明了十万卡规模已经能够围绕任务高效组织起来,也把下一个更宏大的问题推到了台前——一套位于郑州的超大型计算系统,怎样才能被全国的科研团队轻松调用?
十万卡接进一张网
为此,曙光8000落成时做了一个至关重要的动作,同步接入国家超算互联网,依托全国一体化算力网面向科研院所和产业用户提供服务。
这个动作,直接打破了十万卡的物理边界。
如果留在单座机房里,它只是一套规模庞大的本地设备,但一旦接入国家超算互联网,它就摇身一变,成为了全国算力网络中的核心供给节点。
来自北京、上海、深圳等地的海量数据需求,可以经由高速网络直奔郑州,完成计算后再把结果毫发无损地送回去。
在这个网络里,并且单一堆砌、精度有限的纯CPU算力,系统底层基于AI计算开放架构接入了CPU、GPU各种异构资源,中间由平台负责精准匹配任务与机器,顶层则把算力、软件、数据和模型封装成了开箱即用的服务。
用户只需在前端提交需求,平台便会自动寻找能够接单的节点,连同应用环境一起推给任务。而曙光8000把这张网承接大任务的上限,硬生生向前推了一大截。
一张网络可以连接无数座算力中心,但真遇到需要大规模卡群紧密协同的硬骨头任务时,网络里必须有足够强悍的节点能够单枪匹马地“接单”。
曙光8000提供的十万卡资源池,恰恰给算力网络装入了一台能够处理大型科研任务的核心引擎。MCV流畅跑通,展示的正是这种无可替代的供给底气。
这并不意味着所有的任务都要被强行拆开、送往多座城市共同计算。MCV此次运行依然发生在曙光8000内部,而算网的存在,是为了先识别任务的真实需求,再把它送到最合适的节点上。当需要大规模紧密并行时,曙光8000可以整块接住;而当任务较小或节点繁忙时,平台则会灵活寻找其他资源。
这种逻辑,越来越像现代电网的工作方式。想想看,现在有谁会去追问家里的电究竟来自哪座发电厂,大家关心的只有插座能否持续供电。算力显然比电力复杂得多,程序还要直面芯片架构、软件环境和数据安全的重重考验,但交付的方向已经高度一致:用户提出需求,网络组织供给。
接入国家超算互联网后,曙光8000实际上拥有了双重身份,它既是机房里那算力磅礴的十万卡集群,也是网络上随时可以被调用的核心节点。
身份改变的密钥,在于“被找到”。曙光8000的算力、应用和服务已经齐刷刷地出现在了统一的入口里。科研团队面对的不再是一张充满未知的机房地图,而是一份可以随时下单的任务单。
算力开始按任务交付
在国家超算互联网核心节点的服务入口,两类截然不同的身影正在相遇。
一端是MCV这样的国家级重任务;另一端则是高校师生、青年科研团队和中小企业。新用户只需申请少许算力和调用额度,就能先完成模型测试、算法验证或应用原型开发。
任务的规模虽然有着天壤之别,但进入算力的方式却开始走向统一。用户说明需要解决什么具体问题,平台在后台匹配资源,曙光8000等核心节点则负责在前端完成交付。
截至今年7月,国家超算互联网已经汇聚了超过350万核CPU和25万张GPU,平台注册用户突破140万,接入应用服务超过7300项,适配大模型超1500款。
在这串庞大数字背后,曙光8000承担的正是压舱石似的大型核心节点角色。它让这张网络既能轻松分发小规模的试验验证,也有底气接住大规模卡群同时开工的硬核科研。
更重要的是,这张网还在悄然消化着机房与机房之间的“潮汐”。
平台累计调度提供的海量算力,让入网中心的资源利用率得到了显著提升。当某座节点排起长队时,其他节点可以顺势接单;当某批机器出现空档,远处的任务也能立刻补进来。
算力,终于开始从固定在地方上的死资产,变成了一股沿着需求滚滚流动的活水。
当然,这张网依然在建设的路上。不同芯片之间的程序迁移、跨区域的海量数据传输、统一的编程框架与安全规则,依然在考验着交付的成色。
对此,曙光8000先把一个核心节点做到极致。它用300余项应用优化铺平入口,用十万卡资源池抬高任务上限,再用MCV证明这套系统“开机即开工”的战力。而国家超算互联网,正在把这份硬核能力,稳稳地送到了更多用户面前。
中国算力,开始交付一项全新的产品。
未来,等待计算的可能是一种全新的材料、一套复杂的工业仿真、一个关键的药物候选分子,也可能是下一次极端天气的提前预警,背后会是曙光8000面向全国的科研与产业任务的持续供血。
网络会把任务带到曙光8000面前,再把答案,平稳地送反用户。
