英伟达(NVIDIA)是全球最大的 AI 芯片公司,主业是设计数据中心里用的 GPU(图形处理器,AI 计算的主力芯片),也是这轮 AI 热潮里市值最高的芯片企业。它的下一代 AI 计算平台 Vera Rubin(以美国天文学家维拉·鲁宾命名)在 2026 年 8 月的芯片设计顶级大会 Hot Chips 2026 上披露了最新实测结果:在 AI 智能体(Agent,能自主调用工具、分多步完成任务的 AI 程序)工作负载下,整柜版系统 Vera Rubin NVL72 相比上一代平台 GB300 NVL72,每消耗 1 兆瓦电力能处理的文字量(吞吐)最高提升 30 倍——同样的电费,能干的智能体推理活最多多 30 倍。

比 30 倍更值得关注的是实现方式:英伟达这次不是靠一颗更快的 GPU,而是把一次推理拆成四类不同性质的任务,交给 GPU、专用推理芯片、CPU 和网络设备分工完成。

Agent 推理与普通聊天的差别

传统的大模型聊天是「一问一答」:输入固定、输出固定,比的是模型生成文字有多快。Agent 完全不同——它要完成一个任务(比如调研一家公司),会反复读取文件、调用搜索和数据库、执行代码,把结果写回上下文,再进入下一轮推理,直到任务完成。

每一轮累积的内容都会成为下一轮的输入,所以 Agent 任务的上下文(模型一次能「看到」的全部输入)会越来越长。英伟达采用的 SemiAnalysis AgentX 测试负载,取自真实 Agent 编程会话的流量记录,其中中位输入上下文超过 14 万 token——token 是 AI 处理文字的最小单位,14 万 token 大约相当于一部中篇小说的文字量。

英伟达 HPC 与 AI 超大规模基础设施解决方案高级总监 Dion Harris 在大会上解释:传统推理基准用固定输入输出测试,测不出这种动态负载;Agent 任务跨多轮操作,每一步工作负载都不同,评估平台需要考虑数十万 token 级别的输入。

30 倍的测试口径

测试条件为:DeepSeek V4-Pro 模型(深度求索公司出品的大语言模型)、单用户每秒 160 token 的交互速度。英伟达称该结果尚待分析机构 SemiAnalysis 审核。

这里的效率指标是「每兆瓦吞吐」:即每消耗 1 兆瓦电(1000 千瓦),整套系统能生成多少 token。对电力受限的 AI 数据中心来说,这个指标直接决定同样的电费能支撑多少业务——从 GB300 到 Vera Rubin,同样的电,Agent 推理产出最多提高到 30 倍。

四类任务,四个角色

AI 推理分两个阶段:Prefill 是理解输入,计算密集;Decode 是逐字生成输出,受内存带宽限制。Agent 负载把这两阶段的矛盾同时放大:既要处理越来越长的上下文,又要极低延迟地生成 token,还要穿插工具调用。英伟达的应对是把任务拆开:

  • Vera Rubin GPU:承担大规模模型计算,是整套系统的主力;
  • Groq 3 LPX:专攻低延迟 token 生成的专用推理芯片,已进入全面生产。在 Gemma 4 31B 模型、10 万 token 上下文下,其输出速度达每秒 3400 个 token,英伟达称响应速度为最接近替代方案的 4 倍;
  • Vera CPU:处理两次模型调用之间的杂活——工具编排、代码执行、数据处理;
  • Spectrum-X 网络:把计算、数据和存储资源连接起来。

GPU 与 LPX 之间没有固定切分方式,英伟达展示了三种方案:Rubin 处理输入并生成 KV Cache(推理过程中的中间数据)、LPX 负责后续逐字生成;或 Rubin 负责注意力计算、LPX 负责前馈网络计算;也可以让 LPX 跑一个小模型先猜候选词、Rubin 的大模型再做验证(推测解码,一种加速生成的技术)。

分工变细并不意味着 GPU 被替代。Dion Harris 的表述是「为工作负载的不同部分选择合适的处理器」:GPU 仍是计算中心,覆盖最广泛的工作负载;专用芯片在低延迟这个具体瓶颈上补位。

网络层也被拉进关键路径

Agent 不断访问工具、数据和存储,网络面对的不再只是 GPU 之间的数据交换。英伟达这次公布了两项网络侧的配套设计:

  • Scale-In:用 BlueField-4 网卡和 DOCA 软件框架,处理传统数据中心里的「南北向」流量——服务器与外部存储、网络、安全控制之间的通信,再经 Spectrum-X 接入整机系统;
  • Spectrum-X Multiplane:解决大规模 GPU 集群的网络扩展与故障恢复,最高可扩展至 51.2 万张 GPU;在八平面拓扑中,一个平面失效后仍能维持约 90% 的总带宽,故障恢复速度比软件方案快 11 倍。

这两项解决的不是同一个问题:Scale-In 管计算系统与数据、存储的连接,Multiplane 管更大规模集群的扩展与容错。但它们指向同一个变化——决定 Agent 任务效率的环节,正在从一次模型计算向外延伸。GPU 算得再快,如果卡在工具执行、数据读取或通信上,前面省下的时间都会在等待中消耗掉。

结论

英伟达这次展示的明显是面向高并发、长上下文、大规模部署的上限设计,最终能形成多大的市场,取决于 Agent 应用产生多少真实负载、以及复杂的异构系统能否换来足够的性能收益。但架构方向已经清晰:GPU 仍然是 AI 计算的核心,而下一代推理基础设施要优化的对象,不再是一颗芯片,而是从上下文处理、文字生成到工具执行、数据通信的整条 Agent 任务链。 对关注 AI 基础设施的人来说,这句话比 30 倍的数字更值得记住。