首页 > 资讯 > SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持

SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持

赢政天下 2026-09-13 12:04 3 阅读 查看原文
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持

1. 架构概览

DeepSeek-V4.1 引入多项架构选择,深刻影响服务栈设计。低比率压缩与滑动窗口注意力(SWA)让每层维护 fp8 滑动窗口缓存(最近 128 位置),同时选定源层生成 fp4 压缩表示用于长程注意力。

流形超连接(mHC)允许子层通过 token 依赖的混合系数读写四条并行残差流。Engram 内存则让第 1 和第 14 层从两个大型 fp8 表中检索 n-gram 哈希键控行。

2. 跨层共享与稀疏检索

四个 KV 源层生成压缩 KV 和索引键,消费者层直接读取最新源,避免重复存储。Layer 20 选出最多 2048 个候选块并发布,后续索引源层在其上选取 top-512。

Layer roles: compression ratio per layer, KV source, candidate source, index source and Engram layers

图 1. 各层角色与跨层共享示意。

3. Engram 优化

Engram 两个 fp8 表共 189 GiB,每步仅读取少量行。SGLang 支持 GPU 或主机内存放置。主机分片布局保留 all-reduce,共享主机布局则消除该通信。

Engram layouts: GPU-sharded and host-sharded tables retain the lookup all-reduce; shared host tables remove it

图 2. Engram 放置与 TP4 下的查找通信。

实测在 4x GB300 上,主机卸载使 KV 缓存容量提升 36%,吞吐与 TTFT 相当。

4. SWA 有界重放

编码器侧有界重放保留压缩 KV 与索引键,请求维护 128 位置窗口,命中时仅重算末尾 128 token。解码器侧尾部仅计算让 layers 21-39 仅处理最后 128 token。

Encoder-side prefix-tail reconstruction and decoder-side tail-only computation

图 3. 编码器重建与解码器尾部预填充。

8x H200 上解码器重放将预填充吞吐提升 1.56 倍,AIME 2026 评测 pass@1 保持一致。

5. 内核与执行优化

SGLang 实现 mHC 前驱预混合重叠、FP4 索引 TP 复制、融合 RoPE 与 FP4 量化,同时保留量化语义。单 token 投影与 Engram 融合进一步降低每步解码开销。

6. Miles 中的强化学习

Miles 为 DeepSeek-V4.1 提供 Megatron-Core 插件,使用 SGLang 进行 rollout,支持 DP/TP/SP/EP/PP/CP 并行及量化感知训练,最大限度缩小 trainer 与 rollout 之间的 log-probability 差异。