英伟达(NVIDIA,全球最大的 AI 芯片公司)8 月下旬公布了新一代 AI 计算平台 Vera Rubin NVL72 的首批实测数据:在「AI 智能体」类任务上,它每消耗 1 兆瓦电(约 1000 千瓦)能完成的推理工作量,最高达到上一代 GB300 NVL72 的 30 倍;每生成 100 万个 token(大模型读写文字的最小计量单位,可粗略理解为半个词)的成本,最高可降低 35 倍。对受电力配额限制的数据中心来说,这意味着不增加耗电就能支撑规模大得多的智能体业务。
需要先说明口径:这批数据来自英伟达官方博客,用第三方评测机构 SemiAnalysis 的 AgentX 工作负载测量,目前仍待该机构复核,且尚未计入 Vera CPU 参与工具调用的性能。以下数字均按「官方自测、待第三方复核」的前提理解。
智能体任务比普通聊天多消耗 15 倍 token
智能体(agent)是能自己拆解任务、调用工具、分步执行的大模型应用,比如替用户调研公司、写代码、做客服。它和普通聊天不一样:聊天通常一问一答就结束,智能体则要反复查资料、调子程序,把每一步的结果喂给下一步。据 OpenRouter 平台数据,智能体工作负载消耗的 token 量是简单聊天的 15 倍;一次复杂任务里,上下文(模型「记住」的全部历史输入与中间结果)可以累积到几十万个 token,而普通聊天的输入长度通常在 1000 到 8000 个 token 之间。token 用得越多,推理成本越高。
因此,智能体时代的推理芯片,比的不只是单次回答快不快,更是「每度电能干多少活、每个 token 花多少钱」。
两组关键数字的测量方法
英伟达使用 SemiAnalysis AgentX 工作负载——一组录制的真实智能体编码会话,保留实际上下文增长、工具调用与子智能体生成过程——对比了 Vera Rubin NVL72 与上一代 GB300 NVL72:
- 每兆瓦吞吐量最高提升 30 倍:在 DeepSeek V4 Pro 模型上测得。对受电力约束的 AI 工厂(专门成规模运行大模型的数据中心)而言,这相当于同样的电费下能完成 30 倍的智能体工作量;
- 每百万 token 成本最高降低 35 倍:token 成本直接决定 AI 工厂的利润率,成本越低,智能体越能连续、大规模地运行。
作为参照,上一代 GB300 NVL72 在 DeepSeek V4 Pro 模型上,每兆瓦吞吐量已比更早的 Hopper 架构最高提升 15 倍;Vera Rubin 是在这一基础上继续跃升。此外,英伟达的 DSX MaxLPS 电源管理技术,可在同一兆瓦预算内多供给最多 40% 的 GPU。
性能来源:七类芯片加全栈协同设计
Vera Rubin NVL72 不是单颗芯片,而是一个机柜级的整机平台:用英伟达自有的 NVLink 高速互联技术(GPU 之间传输数据的专用通道)把 72 颗 GPU 连成一台巨型计算机。整机由七类芯片组成——Vera CPU(中央处理器)、Rubin GPU(图形处理器,AI 计算的主力)、NVLink 6 Switch 交换芯片、BlueField-4 DPU(数据处理器)、Spectrum-6 SPX 与 ConnectX-9 SuperNIC 网络芯片,以及 Groq 3 LPU 加速器。
效率提升的关键是「协同设计」——硬件与软件一并优化,具体手段包括:
- 分离式服务:把推理拆成「读取上下文」(prefill)与「生成回答」(decode)两个阶段,各自独立扩容,互不拖累;
- 分布式 KV 缓存:KV 缓存是推理时存放已读上下文的内存区,将其扩展到整柜 GPU 共享,并把不活跃的部分分层卸载到主机与存储,长会话无需重复计算;
- KV 感知路由:把新请求派给已经缓存相关上下文的 GPU,减少重复计算;
- MegaMoE 融合内核:把计算与 GPU 间通信合并为一次执行,减少芯片空等;
- NVFP4 量化:把模型权重压缩到 4 位精度,降低内存占用、提高吞吐;
- 第六代 NVLink 的包速率比通用以太网高 10 倍、延迟低 3 倍。
配套的推理软件栈(TensorRT LLM 推理引擎、Dynamo 服务框架等)与硬件同步优化,是这些数字能够落地的另一半原因。
对行业的意义
对 AI 工厂而言,每兆瓦吞吐量决定营收上限,每百万 token 成本决定利润空间——两项指标同时改善 30 倍与 35 倍,意味着智能体业务的「电费账」和「token 账」都被大幅改写。英伟达称 Vera Rubin 已全面投产,正随生态伙伴规模铺开。当推理成本降到这个量级,「让智能体连续跑、大规模跑」将从实验走向日常运营。