首页 > 开源 > AMD 开源 GPU 软件平台 ROCm 诞生十周年,ROCm 10.0 正式发布

AMD 开源 GPU 软件平台 ROCm 诞生十周年,ROCm 10.0 正式发布

OSChina资讯 2026-09-07 16:11 3 阅读 查看原文

2016 年 4 月,AMD 在 GitHub 上推出了 ROCm 1.0。这是一个基于 C++ 编译器和名为 HIP 的 GPU 编程语言构建的开源 GPU 计算堆栈,旨在实现高性能计算。十年后,该平台已在各行各业训练和运行前沿 AI 模型,并支持几乎所有受益于 GPU 的计算应用。

十年后,ROCm 10.0 发布。版本号跳过 8 和 9,直接到 10,同日发布 ROCm.AI——一套面向 AI 开发者的工具链,试图把 AMD 软件栈从「驱动 GPU 的东西」变成「开发者主动想用的东西」。

AMD 官方博客标题里有个短语值得注意:「Agentic AI 时代」。AMD 不是第一次在 GPU 软件上发力,但「Agentic」这个词不是随便放的——ROCm 10.0 里最激进的设计,确实是给 AI agent 用的。

ROCm 10.0

TheRock:改了十年的东西

ROCm 1.0 发布时,MXNet 还是前沿框架,构建系统是手写的 CMake 脚本。每个版本发布靠人工跑脚本、人工验证、人工打包。

ROCm 10.0 的背后是一个叫 TheRock 的自动化构建系统。这套系统从 ROCm 7.14 开始在生产环境跑,6 月 15 日之前就完成了 200 个 nightly release,每个 release 都经过严格测试。AMD 的工程师在博客里写了一句:「经过三年的努力,我们终于可以不需要手动干预,只用行李标签和一台笔记本电脑,就能完成一次 ROCm 的发布。」

这句话信息量很大。行李标签是机场里的概念——你下飞机,找到行李,扫描标签,确认是你的。TheRock 把发布流程简化到这种程度,意味着 ROCm 的版本迭代速度可能不再受人力瓶颈限制。

ROCm.AI:不是 GUI 工具,是 CLI + Skills + Agent 优化

ROCm.AI 分三块:ROCm CLI、AMD Skills 和 Hyperloom。

ROCm CLI 是命令行工具。rocm serve <模型名> 一键启动本地推理服务,rocm examine 诊断 GPU 状态。没有 GUI,没有仪表盘,就是命令行。目标用户是每天在终端里干活的人。

AMD Skills 更有意思。这是一套 Agent Skills 格式的技能包,放在 amd/skills 仓库,可以直接被 Claude Code、Cursor、Codex 等 agent 工具加载。GPU 侧有 rocm-doctorserving-llms-on-instinct,CPU 侧有 serving-llms-on-epyc(走 ZenDNN 和 zentorch 推理)。

也就是说,AMD 不希望你在终端里敲 rocm-smi 自己排查,而是希望你的 AI agent 直接读 AMD 写的技能文件来解决 ROCm 相关问题。Agent 时代,文档不是写给开发者看的,是写给 agent 读的。

Hyperloom:让 AI 替你优化 AI

Hyperloom 是这三块里最激进的设计。

它的工作流是五步循环:Profile → Analyze → Plan → Optimize → Validate。先跑一轮推理,采集性能数据;然后 AI 分析瓶颈;接着 AI 生成优化方案;执行优化;最后验证优化效果。

这套流程的组件包括 TraceLens-Agent(性能分析 agent)、Magpie(自动调优服务)、IntelliKit(生成式内核库)、GEAK(自适应内核)和 Arbor(推理优化引擎)。

AMD 的说法是,这套流程能把优化时间从「几周」压缩到「几小时」。如果这个数字成立,这意味着模型推理调优这件事从「需要资深工程师手动调」变成了「agent 自己调自己」。

其他值得提的

ROCm 10.0 在生态集成上也做了不少工作。vLLM 和 SGLang 现在在 AMD Instinct 上跑到生产级别;Unsloth 支持 Ryzen AI MAX 上的 QLoRA 微调;ComfyUI 在 ROCm 上优化了 Wan2.2、FLUX.2 KLEIN、SD 3.5 Medium 等模型。

RCCL 和 rocSHMEM 的多 GPU 通信性能有提升,hipBLASLt 和 rocSPARSE 做了稀疏计算优化,ROCm Optiq 1.0 提供了 roofline 分析工具。Windows 端也终于有了统一的 SDK。

但这些都不是 ROCm 10.0 最值得关注的部分。

最值得关注的是:AMD 押注的方向不是「更快地跑大模型」,而是「让 AI 帮你更好地用 AMD 硬件」。从 TheRock 的自动化发布,到 AMD Skills 的 agent 可读文档,到 Hyperloom 的 agent 优化循环——这条线贯穿了 ROCm 10.0 的整个设计。

AMD 的软件生态一直是被 NVIDIA CUDA 压着打的。ROCm 10.0 不试图在生态规模上追平 CUDA,而是赌了一件事:在 agent 时代,开发者不再手动查文档、手动调优、手动部署。如果一个 AI agent 能帮开发者搞定这些,硬件平台之间的切换成本会大幅降低。

Hyperloom 能不能真的把优化从几周压缩到几小时,AMD Skills 能不能被 agent 正确理解并执行,这些都需要时间验证。但方向是对的。

参考来源: