首页 > 资讯 > 从绿叶到鲜花,AI 推理如何为 NAND“逆天改命”?

从绿叶到鲜花,AI 推理如何为 NAND“逆天改命”?

36氪文章 2026-09-30 20:55 4 阅读 查看原文

NAND 是一个被“技术诅咒”的行业:正如海豚君在前篇《NAND天性 “多产”,闪迪凭什么守 80% 毛利率?》中所说,AI 爆发前的 NAND 就是典型的大宗生意——产能由市场无情出清,技术领先换不来溢价,只能“亏得比别人少”,销量增长的红利被降价全部吞噬。

根源在供给端太多产:靠单一晶圆上向上堆叠、横向缩孔,从 BiCS5 到 BiCS11 五代,闪迪每片晶圆的 bit 产出 每代 增加 54%,年化复合约 27%。

也就是说,哪怕一分钱扩产(CapEx)不花,bit 产能每年也会自动膨胀近三成。3D 转型期更是一次性猛增,供给一度远超需求,这让“轻资产”NAND 生意在下行周期比“重资产”DRAM 更惨烈。

而 AI 的爆发,正在重写 NAND 的剧本。本篇报告中,海豚君重点关注AI 浪潮究竟给 NAND 下游需求带来了怎样的结构性重塑?

以下为详细分析

1. AI 浪潮究竟给 NAND 下游需求带来了怎样的结构性重塑?

AI之前的消费电子周期中,“话事”需求场景——手机、PC、传统服务器等核心下游增长平稳可预期,缺乏爆发变量,所以周期的大起大落,实质由供给端的无序扩产与急剧收缩主导。

需求增长来自三大动能:单机容量升级、新兴市场渗透,以及固态硬盘(SSD)对机械硬盘(HDD)的存量替代,缓步而稳定。

稳定的需求,配上刚性提升供给,导致NAND 属性被困在经典的“硅周期”中:供过于求、价格暴跌 → 原厂减产,低价同时刺激单机容量升级 → 供需再平衡、价格回升 → 原厂在高利润下追高扩产 → 再次陷入产能过剩。

只要 NAND 摆脱不了“外围零件”的定位,这个死循环就打不破。唯一出路,是出现一个不太看价格、且与 GPU 算力部署直接绑定的新场景——这正是后来 AI 浪潮所扮演的破局者角色。

第二阶段(2025 年之后):AI 推理驱动的结构性爆发

2026 年是 NAND 历史上最具标志性的分水岭:数据中心占 NAND 总需求的比重,从 2025 年约 30% 跃升至 2026 年约 45%,历史性反超智能手机(同期收缩至约 23%),成为最大终端基本盘。

驱动 NAND 需求的主角,从对价格高度敏感、库存大起大落的消费电子,换成了以 TCO(总拥有成本)和算力回报(ROI)做决策、对价格脱敏的云服务商。

云厂商关心的不再是“这季度颗粒够不够便宜”,而是“能否按时拿到足额的高性能 eSSD,保证未来三年 GPU 基建不掉链子”。从“短期压价”转向“长期保供”,正是原厂推行 NBM(新型长协模式)的需求侧基石。

伴随基本盘切换,AI 重心“由训转推”,更让 NAND 的角色质变:

AI早期,NAND 只是外围的“数据仓库”:把训练语料、模型权重、防宕机的 Checkpoint(存档)等静态数据,放在 GPU 能快速调取的近端。这些数据可替代性极强——丢了从数据湖重新下载即可,只花带宽和极少电费,不必动用昂贵 GPU 重算。

但推理时代,计算变成高并发、持续性的“动态消耗”——存储需求与“AI 用户数 × 使用频次 × 上下文长度”强绑定。更关键的是,NAND 首次存储“计算的中间产物”。

长文本推理产生的庞大 KV Cache 不是外部搬来的静态数据,是 GPU 大量消耗算力后生成的“工作记忆”。它一旦丢失,中央仓库没有备份,只能再花昂贵的 GPU 算力和电费重算。

存储的价值第一次可以直接折算成“算力与电费”。正如闪迪所说——SSD 本质上已经进化为一块“Token 电池”:Token 是已经做过的功,与其丢弃重算,不如“充”入硬盘;存 KV Cache 就是帮云厂商省电、省算力。

铠侠的预测也印证了这一趋势:数据中心 NAND 总需求将从 2025 年的 286 EB 增至 2031 年的 1,686 EB(CAGR 34%),且内部结构极度分化:

AI 推理: 从 2025 年的 86 EB 激增至 2031 年的 1,251 EB,CAGR 高达 56%;占数据中心 NAND 需求的比例也从 30% 攀升至 74%。

AI 训练与传统负载: 同期 AI 训练的 CAGR 仅 11%,传统云工作负载(以 CPU 为主)仅 14%。

推理需求的增速是训练的 5 倍——本轮 NAND 超级行情,将主要由推理需求的爆发主导。

先看 NAND 在 AI 数据中心的主要应用:

① KV Cache 卸载——NAND成GPU 的上下文存储层

AI 推理时,GPU 必须为每个 Token 实时计算并维护 KV Cache(模型的“工作记忆”)。但早期架构中它是“算完即弃”的消耗品:一轮对话结束,或 GPU 要腾显存服务下一个用户,HBM 里的 KV Cache 就被清空。

于是用户一旦追问,或多人并发调用同一份超长文档,系统只能把上下文重新喂给 GPU,从头做一次昂贵的 Prefill(预填充)。

Prefill 是推理第一步:GPU 一口气通读全部输入、算清 Token 间的关联(Attention 机制),再生成一遍 KV Cache——这是整个推理中最吃算力、最费电的环节。

过去“用了就丢”,是因为两笔账算不过来:

a. 重算比存起来更便宜: 早期(如 GPT-3 时代)上下文只有 2K Tokens,KV Cache 很小,GPU 零点几秒就能重算完;而存进硬盘要经 CPU 和内存中转、在 PCIe 上“折返跑”,来回耗时甚至超过重算。

b. HBM 又小又贵:GPU 自带显存“寸土寸金”,必须留给当前活跃的计算任务,不可能长期保管已下线用户历史记忆。

但长文本时代推翻了这笔账:从 2020 年 GPT-3 的 2K Token 到 2026 年主流模型的百万级上下文,六年暴涨 500 倍。重算一次百万 Token 的 KV Cache,要让昂贵的 GPU 满载跑好几秒,有算力与电费代价。

这直接促成 KV Cache 的“再定性”:英伟达 ICMS(推理上下文内存存储)架构,正式把它从“算完即弃的临时缓存”改定义为“AI 原生持久数据”。

现在,临时缓存变长久缓存,这个账是否算得过来?

a. 容量约束: 算法压缩也赶不上KV Cache膨胀速度

第一个条件,是 HBM 的扩容速度远追不上 KV Cache 的膨胀。

KV Cache 总量 = 上下文长度 × 并发会话数 × 单 Token 存储量。目前,前两个变量都在被急剧放大:

上下文长度每年翻倍以上:主流模型从 4K、128K 快速演进到 1M+,KV Cache 随之线性放大。

并发与推理轮次爆发——正被三种应用架构急剧放大:

a. RAG(检索增强生成): 问一句话,后台塞进两本书。系统把检索到的大量文档拼接到输入端,送进 GPU 的 Token 远超原始提问,单次任务的 KV Cache 直接拉爆。

b. Agentic Search: AI 从“一问一答”变成自主循环的“规划—调用—评估—再检索”。多步任务把单次 Token 消耗从数百个拉到上百万个。

c. Multi-Agent: 多个 Agent 并发协作,每个独立生成 KV Cache,存储需求随数量成倍叠加。

模型厂商每年至少把上下文扩大一倍,HBM 的物理扩容却接近极限:单卡容量约 2-3 年才翻一倍,红利还在放缓。

判断 KV Cache 会不会溢出,要以单个推理机柜的可用 HBM 池为单位。以 Rubin NVL72 的21T的HBM容量为例:

部署 2.8T 参数的旗舰 MoE 模型,FP8 下权重占约 2.8 TB;再扣掉激活值、分页与框架开销(约占 12%,约 2.5 TB),真正能给 KV Cache 的池化空间上限约 15.4 TB。

不压缩时,10 万 Token 约占 40 GB。即便用最前沿的压缩算法(如谷歌 TurboQuant,16 位压到 3 位、约 5–6 倍无损压缩),100 万 Token 仍要占 67–80 GB。

也就是说,一台造价约 500 万美元的机柜,极限只能同时服务 193–230 个百万 Token 级长度得会话。对企业级云服务而言,这意味着极低的算力变现效率(ROI)。

一旦上下文扩到 500 万 Token,或并发突破这一阈值,机柜级 HBM 池会迅速触顶。因此把 KV Cache 从 HBM 逐级卸载到 DRAM 再到 NAND,往后看是一场必然之路。

b. 便宜,也是致命吸引力

哪怕 HBM 容量勉强够用,用它长期留存 KV Cache 在经济上也不成立:HBM4 约 16 美元/GB,eSSD 约 0.3-0.4 美元/GB,前者是后者的 40-50 倍。用它去放几小时都不调一次的“温/冷 KV Cache”,是极度的资源错配。

为此英伟达确立了新的分层内存架构:G1 HBM → G2 系统 DRAM → G3 本地 SSD(NAND)→ G4 共享网络存储(NAND/HDD),由 NVIDIA Dynamo 在软件层统筹,让 KV Cache 在各层间透明迁移。

英伟达估计,大规模多智能体推理下每个 GPU 模组最高需要 16 TB 的 KV Cache,因此在 Rubin 平台构建了 ICMS/CMX 上下文存储层,位于 G3 本地 SSD 与 G4 共享存储之间,定义为 G3.5 层——因为 G3 容量有限、不能跨节点共享,撑不住多智能体的大规模复用。

CMX 单层容量约 16TB,是单卡 288GB HBM 的近 60 倍——NAND够便宜,才能做到量大不贵。

c. 改用NAND,时延上来得及吗?

卸载值不值得,最终看 TTFT(首 Token 时延)——只有“从 SSD 读回来”的时间和成本低于“用 GPU 重新算一遍”,卸载在商业上才成立。

GPU Direct Storage(GDS)是跨越门槛的关键:它绕过 CPU 和 DRAM,通过 PCIe/RDMA 在 eSSD 与 GPU 的显存之间修一条直连高速路。

据公开验证,GDS 结合压缩技术可把 KV Cache 的恢复时延改善 10 倍,让超低时延的上下文交付在工程上成为现实。

NAND存储KV Cache的数据类型:“共享型记忆”和高频复用

即使跨过容量与成本的门槛,KV Cache 要卸载到 NAND里,还需满足两个条件:

条件一:必须是共享型缓存

a. 短暂型缓存(逐字生成的草稿):HBM承载

AI 逐字回答(Decode 阶段)时,每吐一个字都要全量重读历史上下文。此时强行写 SSD,一是带宽不够、会卡死 AI“说话”的节奏(速度墙),二是高频碎片化追加写几周就能耗尽企业级硬盘的寿命(寿命墙)。所以这类草稿禁止落盘,必须留在 HBM 显存中。

b. 共享型缓存(静态打包案卷):NAND来存

只有当 AI 刚读完超长提示词(Prefill 阶段)、用户切出对话或 Agent 挂起任务时,产生的才是算完、可整段打包写出的完整上下文。它“块大、顺序、低频”,像整箱搬运定稿档案,与 NAND 大块连续读写完美契合,这类数据才可以NAND层。

条件二:高频复用才能“值回票价”

除了可用,经济也要可行:卸载净收益 = 复用次数 × (重算算力成本 − 读回成本) − (写入成本 + 占位存储成本)

GPU 重算既费电又费算力,已算好的缓存从 SSD 读回,只要被复用 1 到 2 次就能盈亏平衡。挑战在于硬盘空间同样稀缺,只有高频复用的上下文,才值这个存储占位。

这最终浓缩为一个核心指标——缓存命中率:命中率越高,边际服务成本越趋近于零。新请求进来时,系统通过“前缀比对”去硬盘取回备份,跳过最烧钱的 Prefill 重算。

正如 Manus 团队指出的:命中缓存的 Token 比未命中的便宜约 10 倍。普通大模型命中率在 40%–70%(MiniMax 71%、Z.ai GLM5 约 40%),多步执行的 Agent 场景则长期企稳在 95% 以上(DeepSeek 实测 98.7%),实现“写一次、读上千次”的红利。

实际使用中,对话变长或 GPU 换用户都会产生中断,当前 KV Cache 就可让出HBM空间。如果这些会话还会被再次调用就可存到 NAND中,服务恢复时再载入。

典型卸载场景包括:用户阅读停顿、跨周期历史回溯、Agent 挂起的长空隙、超大规模并发共享,以及企业级知识库调用。

KV Cache 分层: AI 推理对存储拉动不是单点,而是从高性能闪存(pSLC/TLC)到海量温冷存储(QLC),连同 DRAM 与 HBM,把整条企业级存储产品线一起拉起来。

这条通路上,各类存储分工明确:

DRAM(G2)承接活跃任务的“热溢出”: 它是 HBM 的直接缓冲带,收容同一场活跃会话中因显存触顶放不下的 KV 数据。速度快,会话不卡顿,但断电丢失。

NAND(G3–G4)主导高价值资产的“持久复用”: 跨过断电可保留的门槛后,数据进入非易失闪存主导的持久化复用链路,并沿介质特性逐级下沉:

a. G3 直连层(pSLC/性能型 TLC): 承接刚刚换出、随时可能被重新唤醒的温热会话上下文。

b. G3.5 本地网络层(耐久型 TLC): 承接同一算力集群内,需跨节点高频共享的 System Prompt 与 Agent 状态。

c. G4 远端归档层(大容量 QLC/HDD): 承接海量、极低频调用的 RAG 企业知识库与历史对话归档。

② Staging 场景:TLC 与 pSLC 的刚性基本盘

据闪迪测算,Staging(类似候场类数据,等待被HBM随时调用) 占 2030 年 AI 数据中心 NAND 需求的 40%,是最大的单一板块,且全部由 TLC(含 pSLC)包揽。

打个比方:从数据湖调出的数据,先存在紧贴 GPU 主板的高速 NVMe SSD 缓冲区(G3 直连 SSD)。像厨师案板旁的切菜盘——食材从冷库取出先放手边,不必每切一刀跑一趟冷库。

a. 训练侧 Staging:突发覆盖写

核心任务是给模型做“定时存档”(Checkpoint)与数据集暂存。训练万亿参数大模型时,单次存档高达 TB 级,且每隔几十分钟就要滚动保存一次。

虽然现在能让 GPU“边算边存”(异步存档)、不必停工干等,但这么大规模的集中落盘依然会严重挤占带宽;存档拖得越久,对计算流水线的干扰越大。

所以训练侧 Staging 面对双重约束:既要扛住反复覆盖写入的磨损,又要把写入窗口压到最短。

b. 推理侧 Staging:高并发读取

推理侧 Staging 的三大任务,共同特征是读密集、写极少:

模型冷启动与弹性伸缩:训练机可按月连轴转,但推理机却要随早晚高峰频繁调节容量和开关机,而内存又断电即失。所以新节点上线,都要靠本地 SSD 的强连续读取带宽把参数瞬间搬进空显存,实现“秒级接客”(一天可能触发数十次重载)。

多模型/多版本动态常驻:生产节点常需同时伺候几十 TB 的“全家桶”(不同尺寸、精度、版本)。单卡显存(288GB)和系统内存与之差一到两个数量级,唯有 4–16TB 直连 SSD 装得下整套工具箱。让极少调用的旧模型霸占昂贵显存是错配,下沉至 SSD 换入换出才是最优解。

面对这种极端的 I/O 强度,各类介质逐一被淘汰:

HBM & DRAM:成本极高且容量稀缺,必须留给活跃的 KV Cache;更致命的是 DRAM 断电即失,而 Checkpoint 的意义恰恰是“系统崩溃后还能恢复”。

HDD:吞吐量跟不上 GPU 突发的大块写入,且受体积与功耗限制,根本进不了 GPU 计算托盘所在的机柜。

QLC:擦写寿命约为 TLC 的十分之一(QLC 约 1,000 次,TLC 约10,000 次)。Staging 是 AI 存储栈中写入最重的环节,QLC 寿命会迅速耗尽——这是硬约束,而非成本权衡。

这样,TLC 正好适合 Staging,但TLC在部分场景下还不够,由此衍生出pSLC:

pSLC,是把 TLC 或 QLC 颗粒当 SLC 用——本可存 3 bit 或 4 bit 的 Cell 只存 1 bit。换来更长的耐久度和更低的写入延迟,代价是牺牲约三分之二有效容量。

直接后果是:要达到与标准 SSD 相同的有效容量,需要 3-4 倍晶圆产出。核心触发场景是 RAG 与 Agentic Search 的高频向量检索。

AI 智能体做大规模向量检索新特征(如下),逼着 NAND 必须以高速 pSLC 模式运行:

a. 找得太碎(访问粒度极细): AI 搜索知识库时往往只需比对一小串特征(几百字节)。但标准 TLC SSD 是个“死脑筋”,哪怕只要一个字,也得把整页(4KB)全读出来,浪费读取带宽。

b. 问得太密(并发强度极高): 现在的 AI 会自己做计划、调工具、反复查资料,单次任务瞬间裂变成成千上万个密集的“查字典”请求。标准 TLC SSD 在高并发下迅速排队饱和。

c. 边读边写(读写双向承压): AI 智能体会一边查一边更新索引、记录中间状态。这种“一边翻书一边做笔记”的强度会让普通 TLC 寿命快速耗尽,而 pSLC 寿命是它的十几倍。

但承载这一层的下一代直连架构——NVIDIA Storage-Next(G2.6 层,位于 G2.5 CXL 内存之下、G3 本地 SSD 之上)——仍处在英伟达主导、与铠侠等厂商协同定义规格的阶段。

它的定位,是在 DDR与本地 SSD 之间新增一层 直连GPU的pSLC 存储层,让 NAND 具备接近 DRAM 的 IOPS 与访问粒度(512B 细粒度随机访问),同时保留低成本、大容量优势。

③ Fast Data Lake 场景:QLC 的主战场

如果说 GPU 直连 SSD 是案板旁的“切菜盘”,存储需要读写双能。 G4 远端网络层的 Fast Data Lake(快速数据湖)就是 AI 数据中心的“远端中央总仓”,以读为主:以 PB 级容量装下 AI 运转所需的全部“家底”——训练语料、多模态数据集、各版本模型权重、RAG 知识库和推理回流日志。

按闪迪 2030 年的需求拆分,Fast Data Lake 约占 AI 数据中心 NAND 需求的 25%,几乎全部由 QLC 承载。

核心问题是:QLC 能否替代 HDD?海豚君认为需从以下维度分析:

a. 热数据——QLC 稳坐主位

正在被 CPU/GPU 高频消费的数据(如正在处理的训练集、等待检索的 RAG 知识库),需要极高的数据吞吐量。

HDD 的机械磁头寻道延迟(毫秒级)与 AI 所需的微秒级响应差了两个数量级,从一开始就被物理排除。QLC 凭借超大容量和读写带宽,在此层是替代的绝对主力。

b. 温冷数据:HDD坐主桌

对于“存着备查”和“历史归档”类数据,是否放入 QLC 取决于两个维度:

①供给侧扰动:短期“假性替代”

短期 HDD 将出现 300EB 至 400EB 的供给缺口。当前部分云厂商用 eSSD 临时兜底,造成了“加速替代”的假象。

但 HDD也能用类似SSD的技术持续拉升产能,被 eSSD 临时接管的纯容量需求回流 HDD,替代逻辑变弱。

②经济账:QLC涨价后算不平

短期因缺货有替代迹象,但后续QLC因热数据层的替代是刚需,导致QLC涨价。当下HDD 的每 GB 价差已飙升至 20–25 倍。在稳冷层数据存储中,QLC反而难取代HDD。后续要QLC出现大容量低成本的产品面世后,替代概率才可能加大。

因此 QLC 替代 HDD 绝非单向线性推进,而是分化为三种叙事:

a. 性能关键路径(热数据)上,替代已经完成且不可逆;

b. 温冷归档层,高昂价差阻断了正常置换,目前的“替代份额”更多是 HDD 缺货逼出的“临时补位”,未来面临回流风险;

c. 长期胜负手在于大容量高密度QLC 量产,能否靠极致“空间与能耗压缩”,在 TCO 上跨过 2-3 倍的替换红线。

据闪迪业绩会,超大容量 QLC 在 FQ4'26(2026 年 4-6 月)刚产生首批收入,FQ1'27 进入早期爬坡。闪迪预计 QLC 占整体 bit 出货的比例,从 2025 年约 20% 升至 2026 财年末的 40%,主要由 Stargate (超大容量QLC)在云厂商放量驱动。

④ HBF: 需求上行期权

在传统 AI 存储层级中,紧贴 GPU 的 HBM虽有百纳秒级延迟与超高带宽,但受 DRAM 制程限制,单堆栈容量小、成本高;再往下到 NVMe SSD,延迟与带宽又出现严重断层。

NAND厂商现在在努力推新品:HBF(High Bandwidth Flash)——它的结构基本是HBM的复刻:多层堆叠、TSV贯通连接上下、与XPU共同封装,只是把DRAM颗粒换成了NAND颗粒

闪迪正开发的 HBF,号称堆叠 16 层 NAND、在维持 HBM 级带宽的同时把容量放大 8 倍。(参考:从 HBM 限高到 NAND 加量,英伟达 vs 存力到底谁拿捏谁?)。

HBF 与 HBM 并非简单替代关系,而是基于物理特性的优劣互补:

HBF优势是容量大,成本低,但短板同样明确:微秒级延迟让它反应偏慢,不擅长细碎的随机散读;且有物理擦写寿命上限,只能当“只读参考书”,扛不住高频写入。

此外 HBF 仍在工程推进期:2026 年下半年进入试产建线、预计 2027 年商业化,但紧贴高发热 GPU 部署的散热标准仍待确立。

由此形成分工:

HBM 专注“性能至上”,是旗舰 GPU 的绝对标配,负责对延迟极敏感的预填充(Prefill)阶段、高频读写的活跃 KV Cache,以及要求最高对称读写带宽的训练任务。

HBF 主打“容量为王”,接管以顺序读取为主的常规推理、需单机容纳全量模型的长文本与 MoE 场景,以及读多写少的温冷 KV Cache 卸载,让中低端 GPU 甚至未来的边缘设备也能跑超大模型。

因此海豚君认为,HBF 不是颠覆 HBM,二者共存互补——HBM 管延迟敏感的热数据,HBF 管容量饥饿的温数据。未来HBF的使用渗透还要继续观察。

闪迪将 HBF 分成四种部署形态,具体定义可见《AI 推理大爆发,“悲催” 闪迪真有凤凰涅槃?》。海豚君认为,③ 增配型(HBF+HBM 混搭)和 ④ 解耦型(池化)落地可能性最大。

增配型的逻辑最简单:HBM 不撤,HBF 加进来一起用。GPU 厂商不用大改,HBM 继续干擅长的活,HBF 在旁边装权重和冷 KV 缓存。SK 海力士新提的 H3 架构就是HBM和HBF混搭——2027 年量产、2028 年客户上车,是目前阻力最小的路。

解耦型则是把 HBF 从 GPU 旁独立出来,像硬盘柜一样池化部署、通过网络连接计算单元。这是未来大方向——NVIDIA 的 CMX 方案推的也是类似的机架级存储池;但它要求网络架构跟着升级,预计 2028 年之后才可能成为实际选项。

从各厂商路线来看,HBF 目前仍处于标准联盟阶段,尚未进入 GPU 厂商(特别是 NVIDIA)的官方架构标准中。

闪迪与 SK 海力士是当前唯二的实质推动者:双方已于 2026 年初成立标准联盟并建起试产线,比原计划提前半年——预计2026年底造出芯片,明年推控制器,2027 年冲刺量产。

谷歌、英伟达、AMD 等最早要到 2028 年才可能作为客户采用,但采用≠定义——HBF 真正进入 GPU 厂商的架构体系,还要过标准认证、参考设计集成、生态适配等关卡。

其他厂商:三星有专利储备,但未公开原型与时间表;铠侠走 XL-FLASH 路线(G2.6 Storage Next),与 HBF 不直接竞争;美光暂无公开计划。

总体看,HBF 产业化时间线虽在加速,但格局本质是“存储厂商在推动,GPU 厂商尚未上车”。真正的分化要等 2027 年样品表现,以及 2028 年头部客户是否正式将其纳入系统设计。

总结:

AI 对 NAND 的重塑,不只是把需求曲线抬高一个台阶,确实有希望打破“硅周期”宿命: “算力部署与推理负载主导”下,NAND 也从“外围零部件”变成“计算路径上的必需品”。

在“由训转推”与长上下文时代,用NAND存 KV Cache 是保存昂贵的 GPU 算力与电费资源,SSD 一定程度上就是“Token 电池”。

据闪迪测算,2030 年 AI 数据中心 NAND 出货量将达 1.2 ZB(较 2026 年增长约三倍),三大核心负载分工明确:

a. Staging 暂存层(占比 40%):贴近 GPU 的极高强度 I/O 缓冲区,受极端覆盖磨损与高并发限制,由高性能 TLC(及 pSLC)垄断。

b. KV Cache 卸载层(占比 35%):推理时代全新增量,承载HBM 溢出的动态存储容量,由 TLC/QLC 梯次承接。

c. Fast Data Lake 快速数据湖(占比 25%):远端中央数据总仓,由大容量 QLC 稳坐主位。

按 NAND 类型计,TLC 占 66%、QLC 占 34%:占比最大的 Staging 因写入强度,天然排斥 QLC,TLC 稳占基本盘;QLC 聚焦数据湖与温冷 KV Cache 卸载。

这三类负载的演进方向恰好相反:数据湖向“更便宜”走(QLC 容量放大),Staging 与热路径则向“更快更耐用”走(TLC 乃至 pSLC,牺牲约三分之二容量换取 10 倍耐久性)。

而这波涨价的“超级行情”还能飞多久?站在当前估值节点,涅槃后的闪迪是否仍有向上空间?海豚君将继续在下篇为您拆解,敬请期待!

本文来自微信公众号 “海豚投研”(ID:haituntouyan),作者:海豚君,36氪经授权发布。