KV 缓存是现代 LLM 推理系统的核心组件。多轮 Agent 会话的上下文以键值对形式缓存于 GPU 内存中,供后续解码步骤复用。随着上下文窗口扩大,KV 缓存对显存容量和带宽的压力日益增大。
NVFP4 格式与双级缩放
NVIDIA 在 Blackwell 架构中推出 NVFP4 格式,采用 E2M1 四位值配合每块 16 值的 FP8 块级缩放和 FP32 张量级缩放,有效控制量化误差。
SGLang 中的 NVFP4 KV 实现
实现连接 SGLang 分页 KV 缓存与三种注意力路径:初始预填充、块状预填充/扩展以及解码。
解码注意力内核设计
解码阶段内核直接从 NVFP4 KV 缓存读取数据,在内核内完成到 FP8 的实时反量化,避免额外内存往返。
精度评估
在 Qwen3.5-397B-A17B 上,NVFP4 与 FP8 精度差异极小(<0.1%)。Qwen3.8-27B 上部分任务精度下降 0.3-1.6 个百分点。
性能表现
在单张 RTX PRO 6000 Blackwell GPU 上测试,NVFP4 KV 使解码吞吐提升 26-30%,支持更高并发。
结果表明,NVFP4 KV Cache 在保持高精度的同时显著提升长上下文与 Agent 推理效率。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接