DeepSeek 这个模型名本身就在剧透它的命运——deepseek-v4.1-flash-expires-on-0910。光看这串字符就知道,9 月 10 日它会自动下线。
9 月 8 日下午,DeepSeek 放出了 V4.1 Flash 的中间测试版本开启内测。不是正式发布,是把还没定稿的模型拿出来让开发者提前试,窗口只有两天。

值得注意的不是「又发了个模型」,而是「换了新架构」。官方说法里四个字最重要:新的模型结构。V4 系列沿用的是现有架构,V4.1 Flash 直接重构了,同时把多模态做成了原生能力——不再是 V4 Flash 那样外挂一个独立的 Vision 扩展包,图文输入一体化。也就是说这次是架构层面的迭代,不是参数调优。
调用方式几乎零成本:base_url 不变,把模型名一改就能跑。计费和 V4 Flash 完全一致,没有内测加价。
价格(每百万 tokens):
| 时段 | 输入(缓存命中) | 输入(未命中) | 输出 |
|---|---|---|---|
| 空闲 | 0.05 元 | 1.5 元 | 4.5 元 |
| 高峰 | 0.1 元 | 3 元 | 9 元 |
开发者最快感知到的是速度。X 上已经有人晒实测,最高的输出速度到 507 tokens/s;让模型写 SVG 动画(一只鹈鹕骑自行车)跑到 328 tokens/s;多位开发者反馈平均超过 300 tokens/s。V4 Flash 本身就以快著称,这个数字又往上顶了一截。

但有一个限制被很多人忽略了:并发。内测版每账号只给 20 并发,而 V4 Flash 正式版是 2500,V4 Pro 是 500。这个落差说明 DeepSeek 根本没打算让你拿它跑线上业务——20 并发只够做功能验证和效果测评,压测和规模化流量都不现实。想清楚这一点,就不会把「限时」理解成「抓紧上线」了。
那这次内测到底想验证什么?AGI 知路的分析点得比较透:V4 Pro 推理强但贵,不适合海量流量;旧 Flash 便宜快但复杂推理和原生多模态不够。如果 V4.1 Flash 正式版能做到「接近 Pro 的能力 + Flash 的价格」,大量 To-C 应用和 Agent 产品会从高价旗舰模型迁移过来。这次内测的目标,就是验证新一代 Flash 架构的综合表现,评估它能向上承接多少原本属于 Pro 的业务。
官方同步开了一份匿名反馈问卷,四大模块里专门有一项是「对标 V4-Pro 的替代可行性评估」。看得出 DeepSeek 想知道的是:你们这些用 Pro 的人,愿不愿意换成更便宜的 Flash。

回头看 DeepSeek 这一轮更新节奏,密度高得反常:7 月 31 日 V4 Flash 正式版 API 公测,8 月 13 日 V4 Pro 正式版 API 发布、同日 Harness v0.1 开源,8 月 21 日 V4 Flash Vision Exp 上线,8 月 31 日开源。不到 40 天,四五个动作。V4.1 Flash 内测,大概率是新一轮更新周期的开头。
如果你手头有 DeepSeek 账号,现在改个模型名就能玩,9 月 10 日之前。