2026 年 9 月 2 日,据 DigiTimes 报道,美光正在研发高耐久性 NAND 闪存模块,计划将其部署到距离 GPU 更近的位置。这项被称为「近 GPU NAND」(near-GPU NAND)的方案,目标是让 GPU 直接访问数百 GB 的 NAND 存储池,使大语言模型(LLM)推理不再受显存容量限制。目前该方案仍处于研发探索阶段,尚未落地。
传统方案的瓶颈
大模型推理时,模型数据主要存放在显存(HBM、GDDR7 等)中,容量有限;更大规模的数据则要从距离 GPU 较远的存储池取用,中间经过多个协议层,延迟和带宽都不理想。NAND 闪存容量大、成本低,但此前没有被用作 GPU 的贴身存储。
美光的折中方案
美光的思路是把 NAND 芯片直接放进 GPU 封装内部,或布置在 PCB 基板上,工作方式类似 HBM、GDDR7。与传统 TLC、QLC NAND 相比,这种芯片的存储密度更低,设计重点放在提升 I/O 速度与带宽上,同时兼顾高耐久性——在存储密度与耐久性之间取得折中。
新存储层的位置
近 GPU NAND 位于显存与普通存储之间,充当高速缓冲层,适合承载对低延迟、高带宽要求不极端的部分工作负载。GPU 可以直接访问这一层,不必绕道远端存储池。
对 AI 推理的意义
如果方案落地,LLM 推理的规模将不再受显存容量限制。目前扩大模型规模主要靠堆显存,成本高、扩展慢;近 GPU NAND 相当于在显存之外增加一层大容量高速缓存,让更大规模的模型可以在有限显存的环境中运行,直接影响推理成本与部署灵活性。
就目前公开信息而言,可以确认的只有「美光正在研究」这一步,产品形态与量产时间均未公布。这项探索的意义在于:一旦近 GPU NAND 成熟,显存容量将不再是 LLM 推理的瓶颈,大模型推理的规模与成本结构可能被重新定义。