首页 > 资讯 > 深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

雷锋网 2026-09-10 19:00 1 阅读 查看原文
KV 缓存暴降 437 倍,Agent 成本大洗牌。

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。
这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。
但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse Attention 2(CSA2)和 low / high / max 三档可调推理力度旋钮,打破了这一潜规则。能让 DeepSeek V4.1-Flash 以极低的成本,在不少评测中,智力超越上一代 DeepSeek V4-Pro。
这套新架构把大模型的“记忆体积”压缩到了极致,运行时的显存占用直接砍掉了3/4,存进硬盘的长期记忆更是只占用上一代的1/8 。
这种降维式的成本削减,意味着百万 Token 级别的超长上下文,可以真正进入工业级的生产力阶段。
图片

01


CED架构:把百万上下文“读薄”,

预填充算力砍半

要理解这次架构重写的含金量,必须先看看以往长文本 Agent 场景中,最烧钱的地方是哪里。
答案是预填充。
在智能体的真实运行中,无论是每一次工具调用的结果返回,还是每一轮多轮对话的推进,大模型都必须把全部上下文,从头到尾过一遍,生成 KV 缓存记忆,这个过程就叫预填充。
在百万级上下文场景中,单是这一步就能吃满整张GPU。
上一代 DeepSeek V4-Flash 使用混合注意力架构,只给预填充提了速,让AI“读得更快”,却没有减少“读得容量”
DeepSeek V4.1-Flash采用的 CED 架构可以直接预填充算力减少一半,进而将服务器硬盘上的持久缓存成本,缩减到上一代的1/8。对于调用 API 的企业而言,这意味着原本跑一次深度复杂任务需要支付 10 元的算力账单,现在直接被降维打击到了 1 到 2 元的“平民价”级别。
这是怎么做到的?
DeepSeek V4.1-Flash的神经网络一共有40层,CED 架构把40层分成了两部分。前20层,它用一套“因果编码器”把全部上下文读一遍,然后在隐状态中输出一个高度浓缩的“摘要”;后20层,它不再从头读一遍,直接通过投影矩阵,从编码器的“摘要”里生成自己需要的全局KV缓存。
这就是“先读薄”,“只捞重点”,这一招直接把预填充的计算量砍掉一半。
不过只靠“摘要”当然不够。比如写代码时,项目整体逻辑可以靠摘要理解,但在面对刚生成、需要确保绝对精准的就近内容时,就需要“滑动窗口注意力(SWA)”来盯局部细节了。
不过,这些就近的局部记忆,无法直接从编码器的摘要中复用。如果为了追求 100% 精确而将最近的上下文重新看一遍,又会算力爆炸。
为此,DeepSeek 设计了一套“有限回放”机制挑出极少数 Token,用近似值还原短期记忆。这样,可以用极低成本来复现细节。
图片

02


 CED 解决 “读得慢”,

CSA2 解决 “存不下”

如果说 CED 架构砍的是“上下文”的计算量,CSA2 架构砍的是“上下文”的存储量。
在上一代 V4-Flash 的时代,存储记忆的方式极其粗放,它采用的是 CSA+HCA 混合架构,其特质是每一层都会保留一套完整KV缓存和索引。即哪怕保存的是同一份上下文,40层神经网络,会保存40份副本,这直接导致显存爆炸。
而V4.1-Flash直接采用 CSA2 架构,实现跨层KV复用和跨层Top-K索引复用,让40层网络共用同一个副本,直接降低显存占用。
这套全新的压缩稀疏注意力机制,彻底简化了前代 CSA 的内部设计:它删掉了重复压缩区,扔掉了记录绝对位置的繁琐算法,精简了所有中间步骤。最聪明的是,它不再走独立的隐状态压缩通路,而是直接把核心记忆转换出来使用。这一套精妙的减法,让大模型在狂省显存的同时,训练和运行也变得更加简单丝滑。
为了把这套跨层复用做到极致,CSA2给每层静态分配三种运行模式:
  • Full模式擅长总结,它通读全部上下文,生成完整KV和索引,筛选出Top-K重点条目;
  • Reindex模式,不再自己去存储庞大的缓存记忆,会直接拿Full完整模式生成的完整 KV 缓存记忆,按照自己的理解,重新筛选重点;
  • Reuse模式,拿到上面的编辑,直接开始干活,完全跳过复杂的索引计算。
这样一来,在整个网络中,只有极少数层处于需要死磕的 Full 模式,大幅削减重复存储和索引计算。
如果面对的是超长上下文,还有分层稀疏索引器做进一步优化。Full模式会在扫完上下文后,圈出重点,构建浓缩索引池;后面的层只需要在这个浓缩的小池子里进行二次检索和打分。这样字数再膨胀,算力依然不涨。
在层间复用利用到极致后,V4.1-Flash还采用了 FP4 量化,把单份 KV 的体积也压下去。
针对不同周期的记忆,它直接分层对待。它把长期核心记忆(主 KV 缓存)直接砍成了极低精度的 FP4 格式,把短期就近细节(SWA-KV 缓存)保留了原汁原味的高精度(FP8),这样分层处理后,硬件运行起来变得无比简洁、省空间。
为了让大模型在长期记忆如此模糊的情况下不迷失,DeepSeek 在训练阶段就引入了量化感知训练(QAT),提前让模型使用在模糊世界里精准干活。等到了实际运行时,芯片再把它一秒还原回来做计算,精度损失几乎察觉不到。
CSA2 再叠加 FP4 后,全局单Token KV体积压到V4-Flash的1/4;再叠加CED和SWA有限回放,最终落盘的持久 KV 缓存更是直接降到了前代的 1/8。
在这份惊人的账单缩减中,整整一半的收益来自短期细节记忆用完即弃,而另一半则来自于全局长期记忆本身的架构与量化压缩。
图片

03


创新架构,

重新定义大模型的竞争维度

作为一款主干参数 552B、外挂 196B Engram 记忆模块的模型,DeepSeek V4.1-Flash运行时输入预填充阶段仅激活 8B 参数,解码生成阶段也只激活 16B。就是这样的激活规模,在核心知识、推理、编码能力上已经追平自家上一代 1.6T 参数的旗舰 V4-Pro,部分内部留出评测甚至实现反超。
如果说对标自家旗舰还只是内部的 “以小博大”,那么在公开 Agent 基准里,它在衡量代码智能体真实工程问题解决能力的 DeepSWE v1.1 测试中,V4.1-Flash 拿到 74.2% 的通过率,一举超越 Opus-5.0 与 GPT-5.6-Sol 两款行业标杆;在网络安全智能体测试集 CyberGym 上,它更是拿下开源生态的 SOTA 成绩。
一个 Flash 级别的轻激活模型,在长序列复杂 Agent 场景下把一众顶级稠密模型甩在身后,这在过去 “参数大小决定上限” 的时代,几乎是不可想象的。
在能力大涨的另一面,是长上下文 Agent 的部署成本进一步降低。在 CED 架构与 CSA2 第二代压缩稀疏注意力配合下,全局 KV 缓存压到 V4-Flash 的 1/4,落盘持久 KV 更是只剩 1/8;上下文长度从 4K 拉伸到百万 Token,解码计算量仅上涨约 25%,几乎走平。曾经压在企业身上的显存、存储、带宽三座大山,被这套架构组合同时撬动。
有意思的是,近期唐杰团队发表的《Trace as State: Reasoning Traces as Conditional States for Long‑Context Transformers》,二者在宏观思路上有相通之处:都希望避免每一层完整重放全部上下文,通过摘要浓缩、按需调取重点来缓解长上下文压力。不过两者实现路径完全不同:V4.1‑Flash是底层网络架构重写;Trace as State属于推理阶段的外部算法,不改动模型权重。
把视线放长远,如果 CED+CSA2 这套架构骨架被行业广泛借鉴,下一代旗舰大模型未必会继续走大一统稠密 Transformer 的老路。更多会是稀疏机制、跨层复用、可控近似策略精细拼装出来的产物。
参考链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。