【TechWeb】9月10日消息,DeepSeek官宣正式发布全新模型 DeepSeek V4.1 Flash。该模型是 DeepSeek 全新模型结构系列中尺寸最小的版本,具备原生多模态视觉理解能力。
据官方介绍,新模型结构的设计初衷是追求更高的能力上限、更快的推理速度、更大的吞吐量,并可扩展至更大参数规模的模型。
非对称结构实现“小成本大智能”
DeepSeek V4.1 Flash 采用 552B 参数的 MoE 架构,并引入全新的 Causal-Encoder-Decoder 结构。其输入与输出不对称:输入激活仅为 8B,输出激活为 16B,成本显著低于已知的同尺寸模型。同时,该模型采用新的预训练方式,并经过更大规模的强化学习后训练。在基准测试中,V4.1 Flash 成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
新一代模型大幅减少了 KV Cache 缓存大小。与上一代模型相比,V4.1 Flash 对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。官方数据显示,相对于初代模型,DeepSeek 的 KV Cache 已缩小 437 倍。
API 全面上线,V4 Pro 计划有序下线
DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,用户将模型名称更改为 `deepseek-flash` 即可调用。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线,出于兼容考虑,模型名 `deepseek-v4-flash`、`deepseek-v4-flash-vision-exp` 将被暂时路由到 V4.1 Flash。
经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此 DeepSeek 计划有序下线 V4 Pro 模型。北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 `deepseek-v4-pro` 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
腾讯(WorkBuddy、CodeBuddy)和 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash。
定价下调,峰谷计费鼓励错峰使用
得益于模型架构的创新,DeepSeek V4.1 Flash 能够以更低成本服务更多用户,因此官方相应下调了定价。同时,为更合理地调配资源,仍采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格于 2026 年 9 月 10 日 12:00 开始生效。
DeepSeek 表示,将全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署范围。
