2026 年 8 月 24 日,英伟达在加州 Palo Alto 举办的芯片行业年度技术大会 Hot Chips 上宣布:新一代推理加速器 Groq 3 LPX 全面投产。第三方基准机构 Artificial Analysis 的测试显示,它运行开源智能体模型 Gemma 4 31B 时,在 10 万 token 长上下文场景下输出速度达每秒 3400 个 token,按英伟达的说法,比「最近的替代平台」快 4 倍。Nebius、CoreWeave、SpaceXAI 已成为首批采用者。

Groq 3 LPX 是什么:简而言之,它是英伟达专为 AI「写答案」环节打造的芯片。英伟达是全球最大的 AI 芯片公司,绝大多数大模型的训练和运行都在它的 GPU(并行计算芯片,擅长同时处理海量计算任务)上完成。AI 的工作分两段:训练(用海量数据教模型学会能力,类似上学)和推理(模型回答问题的过程,类似上班)。过去几年行业把主要投入放在训练上;现在模型学成、开始大规模上岗,推理压力陡增——尤其是智能体(Agent)应用兴起之后:AI 不再只答一句话,而是自己拆任务、查资料、调用工具、与其他 AI 协作,一次交互动辄生成几万到十万个 token(token 是 AI 读写文本的最小单位,一个汉字或半个英文单词大约对应一两个 token)。任务链条越长,每一步的生成延迟越会被层层放大。

Groq 3 LPX 的设计核心是分工。它不单干,而是与英伟达新旗舰平台 Vera Rubin NVL72(一款为 AI 数据中心打造的机架级计算系统)配套使用:Rubin GPU 负责吃下超长上下文——把用户提供的大量背景材料读完、理解;LPX 则内置 LPU(语言处理单元,专为逐词生成文本设计的芯片架构),专门加速解码——也就是 AI 一个字一个字写出答案的过程。英伟达称这是「极度协同设计」(extreme codesign):从芯片、网络到整机一体规划,一台机架最多可装 256 颗 LP30 加速器,通过芯片间直连组成一台大型推理引擎,目标是在速度和吞吐量之间不再二选一。

3400 token/秒是什么概念:作为参照,日常使用的聊天类 AI 应用,输出速度普遍在每秒几十到几百 token;3400 token/秒意味着快出近一个数量级。更值得注意的是测试条件:这是在 10 万 token 长上下文下测得的——上下文越长,模型每生成一步都要「回忆」更多资料,速度通常掉得越厉害。能在长上下文里保持这个速度,说明它就是冲着智能体应用去的。测试所用模型 Gemma 4 31B 是开源模型,测试条件相对透明。需要说明的是,英伟达没有公布「最近的替代平台」具体指哪家产品,4 倍的说法可作参照,不宜直接横向对比。

首批客户是谁:

  • Nebius:AI 云厂商,第一个采用 Groq 3 LPX 的云平台,将 LPX 部署进名为「Token Factory(token 工厂)」的服务体系,面向需要实时交互的开发者——智能体、编程工具等场景。按英伟达的提法,AI 数据中心正在变成「token 工厂」:机器批量产出 token,token 成为 AI 服务与计费的基本单元。
  • CoreWeave:AI 云厂商,已在生产环境部署 Spectrum-X Multiplane——英伟达的网络方案,用多组并行交换机连接 Vera Rubin 机架,提供大带宽、低损耗的 AI 网络。
  • SpaceXAI:宣布下一代智能体 AI 将围绕 Vera Rubin 构建,部署英伟达 Vera CPU(服务器中央处理器,负责通用计算与调度)来处理编排、工具调用、代码执行、数据处理与仿真等 CPU 密集型任务,范围从地面数据中心延伸到轨道卫星。

速度背后的另一半是网络:芯片再快,如果成百上千台机器之间的网络拖后腿,纸面数字也落不了地。英伟达同场展示的 Spectrum-X Multiplane 方案,把每台服务器的网络连接拆成多个独立「平面」,各自走轻量两层网络,无需再增加一层交换层级,就能把 AI 工厂规模扩展到 51.2 万块 GPU。官方给出的可靠性数据:八平面拓扑中坏掉一个平面,系统仍保持约 90% 的带宽;硬件级流量重路由比软件方案快 11 倍;整体为 AI 工厂带来 1.6 倍的产出提升。

可以带走的结论:这场发布的信号很明确——AI 竞争的焦点正在从「训练出更强的模型」转向「更快、更省地服务模型」。英伟达用 LPX 芯片、Vera Rubin 整机、Spectrum-X 网络把「AI 数据中心」重新定义成「token 工厂」,瞄准的是智能体应用普及后的商业现实:秒级响应、极低延迟、按 token 计费的成本效率。至于 3400 token/秒是可持续的满载表现还是友好条件下的峰值,要等首批客户 Nebius 等上线后跑出的真实业务数据来检验。