2026 年 8 月 31 日,分析师郭明錤发布最新产业调查:英伟达已重启专用于 AI 推理预填充加速的 GPU「Rubin CPX」项目,设计经过大幅调整,预计 2027 年第一季度开始生产。新芯片与标准 Rubin GPU 按 1:1 配对部署,专门承接推理过程中「读入输入、建立 KV Cache」这一环节的算力负载。
预填充负载占推理工作量一半以上
一次大模型推理可以拆成两个阶段。第一阶段是预填充(prefill):模型读完用户的全部输入,把内容加工成可供后续快速检索的缓存结构(KV Cache)。第二阶段才是逐字生成回复。
郭明錤的调查显示,当前 AI 推理工作量中超过 50% 来自处理输入并建立 KV Cache。预填充不是推理的边角料,而是占大头的那一半。用通用 GPU 承接这部分负载,既贵又不够灵活。
专用预填充芯片的思路,就是用更低成本、更具弹性的部署方式把这块负载接走,让标准 Rubin GPU 专心做生成。
新 Rubin CPX 的关键规格
新 Rubin CPX 拥有接近标准 Rubin GPU 的算力,预填充性能进一步提升,配备 168GB HBM4 内存,取代旧版 Rubin CPX 的 128GB GDDR7(168GB 或对应 7×24GB 颗粒组合设计),单体最高功耗为 2300W。
在托盘与机架层面:8 颗新 Rubin CPX 组成 1 个计算托盘,单个托盘拥有 1.34TB HBM 内存,足以满足大多数长上下文预填充与 KV Cache 建立需求;8 个计算托盘组成 1 个机架模组,模组内部以 Spectrum-6 全铜以太网横向扩展(Scale-out)。
新 Rubin CPX 采用独立的 MGX ETL 机架,每个机架容纳 1 至 4 组机架模组,模组之间的横向扩展采用 Spectrum-6 加 OSFP 光学方案。
与标准 Rubin 的配合方式
英伟达建议 Rubin CPX 与标准 Rubin 按 1:1 配对:Rubin CPX ETL 机架与 Vera Rubin NVL72 机架之间,通过基于以太网的 RDMA 连接。
这等于把推理算力拆成两半:标准 Rubin 负责生成,Rubin CPX 负责预填充。对云厂商和算力运营商来说,部署一套标准 Rubin 机架时,可以按需搭配同等规模的 CPX 机架,把预填充负载从通用 GPU 上分流,让每块芯片跑在自己擅长的环节上。
推理降本的下一个战场
预填充从通用 GPU「顺带干的活」变成一块专门芯片的职责,背后是 AI 推理成本结构的变化:生成环节的算力被不断优化后,处理输入、建立 KV Cache 的开销浮出水面,成为新的降本对象。
Rubin CPX 是英伟达在 Rubin 世代针对推理侧的重要差异化布局。2027 年第一季度量产,是这条产品线下一个值得关注的时间点。