继 DeepSeek V4 Flash 专用推理引擎 ds4 之后,Redis 作者 antirez(Salvatore Sanfilippo)又出手了——h3.c,一个纯 C 语言写成的 MiniMax-H3 原生推理引擎,专门为 Apple Silicon Mac 打造,目标是把文本生成视频这件事从云端搬回本地。
"这个项目正在作为一系列可工作的垂直切面构建。"antirez 在 README 里写道。从目前公开的代码来看,h3.c 并非一个完整的端到端视频生成工具,而是一个逐步逼近目标的底层推理实现——它首先打通的是 MiniMax-H3 模型在 Mac 上的原生运行链路。
为什么是 MiniMax-H3?
MiniMax-H3 是 MiniMax 开源的一款视频生成模型,其架构基于 Diffusion Transformer(DiT),并引入了稀疏注意力机制来降低长序列生成的计算开销。antirez 选择它作为移植目标,一方面是因为模型权重已开放,另一方面则是因为其架构在 Apple Silicon 的统一内存架构(UMA)上有天然的带宽优势——Mac 的大统一内存可以容纳完整的模型权重,而无需像 NVIDIA GPU 那样频繁进行显存换入换出。
技术实现:纯 C 与 Accelerate 框架
h3.c 的核心依赖只有两个:Accelerate.framework 和 Metal。antirez 没有使用 PyTorch 或 TensorFlow,而是直接用 C 语言实现了张量运算、注意力机制和采样逻辑。在 README 中,他特别强调了性能目标:
"在 M4 Max 上,我们希望达到每秒 1-2 帧的生成速度(512x512 分辨率,8 秒视频)。这需要极致的算子融合和内存复用,而不是简单地调用现成的 BLAS 库。"
目前项目已实现的基础功能包括:
- 文本编码器的前向推理(T5-XXL 的 C 语言移植)
- DiT 主干网络的去噪循环(支持 CFG 引导)
- VAE 解码器(将潜变量还原为像素帧)
- 基于 Metal 的矩阵乘法与注意力内核
当前状态与后续路线
antirez 在项目日志中透露,h3.c 目前处于"能跑通但未优化"的阶段——在 M4 Max 上生成单帧 512x512 图像大约需要 4 秒,距离目标还有明显差距。他计划下一步优先优化注意力算子的内存访问模式,并考虑引入 Flash Attention 的 C 语言实现。
值得注意的是,antirez 明确表示不会支持 NVIDIA GPU,理由是"CUDA 生态已经足够拥挤,而 Apple Silicon 的本地推理才是更有趣的挑战"。这一立场延续了他此前在 ds4 项目中的态度——专注于让大模型在个人设备上高效运行。
对于普通用户而言,h3.c 目前还只是一个技术预览,但它的意义在于:当视频生成模型可以完全离线运行在 Mac 上时,创作工具的边界将被重新定义。antirez 的代码风格依然保持着"极简但可读"的特点,整个项目目前只有约 8000 行 C 代码,却涵盖了从文本编码到视频解码的完整链路。