2026 年 8 月 24 日,在芯片行业的顶级技术会议 Hot Chips 上,英伟达集中披露了新一代 AI 基础设施的多项进展:面向推理加速的芯片 Groq 3 LPX 进入全面量产,以太网方案 Spectrum-X 可以把 GPU 集群扩展到 51.2 万颗的规模,同时首次允许云厂商自研芯片接入英伟达的机架互连体系。这些动作指向同一个判断:英伟达的竞争边界,正在从一颗 GPU 扩大到一整座 AI 工厂。

背景:英伟达与它的 AI 工厂

英伟达(NVIDIA)是全球最大的 AI 芯片公司。它起家于显卡(GPU,图形处理器)生意,如今几乎所有主流大模型都在英伟达的 GPU 集群上训练和运行。所谓大模型,就是用海量文本训练出来、能理解和生成文字的 AI 程序,ChatGPT 背后就是这类技术。

AI 工厂是英伟达近年提出的概念:把 GPU 集群比作一座工厂,投入数据、产出智能。Vera Rubin 是英伟达下一代 GPU 计算平台的代号,此次 Hot Chips 披露的各项产品,都是围绕 Vera Rubin 构建的工厂级方案——GPU 负责训练和通用推理,Groq 3 LPX 负责加快回复生成,NVLink 完成机架内互联,Spectrum-X 连接大规模集群,Scale-In 处理基础设施服务。

Groq 3 LPX 量产:专攻回复生成速度

Token 是 AI 读写文字的最小单位,一句话通常由几十到几百个 Token 组成;推理则是模型根据输入生成回答的过程。Groq 3 LPX 是英伟达定义的交互式 AI 推理加速器:它不负责训练,也不替代 Vera Rubin GPU,而是专门加快推理时生成回复的速度。

英伟达单独做这颗芯片,是因为新一代 AI 应用不是问一句答一句。代码智能体(能自己读代码、写代码、跑测试的 AI 程序)一次任务要执行几百上千步,每一步都在等模型生成,等待层层累积,最终决定一个任务是几分钟完成还是几小时完成。回复生成越慢,这类任务拖得越久。

英伟达公布的数据是:在评测平台 Artificial Analysis 用开源模型 Gemma 4 31B 测试,10 万 Token 上下文(模型一次能处理的输入范围)条件下,Groq 3 LPX 达到每秒 3400 个输出 Token,是该模型有记录以来最快的成绩;在智能体这类对延迟敏感的负载上,响应速度约为最接近的替代平台的 4 倍。

采用方面,AI 云服务商 Nebius 成为首家采用者,计划把 Groq 3 LPX 接入其生产级推理平台 Nebius Token Factory,开发者可以继续使用原有 API(程序调用接口)而无需迁移软件栈;Groq 也计划跟进。首批部署将来自 AI 云服务商。

Spectrum-X 多平面:51.2 万颗 GPU 的以太网集群

训练大模型需要成千上万颗 GPU 协同工作,把它们连起来的网络就是集群的骨架。以太网是数据中心最通用的组网技术,但传统两层以太网集群规模一大,往往要增加第三层网络,随之而来的是更多交换跳数、延迟和抖动,以及交换机和光模块成本的上涨。

Spectrum-X 多平面架构换了一种做法:把每台服务器的网络连接拆成多个独立平面,每个平面都是一套完整的两层网络,多个平面组合后整体最高可扩展到 51.2 万颗 GPU,而应用看到的仍然是一条完整连接。流量分配由 ConnectX SuperNIC(智能网卡)内置的硬件引擎完成,一个平面故障时,流量会自动重新分配到其他平面。

关键数字:八平面拓扑下,一个平面失效后系统仍可保留约 90% 的总带宽;英伟达称其基于硬件的恢复速度比基于软件的多平面负载均衡快 11 倍,并可使 AI 工厂产出提高 1.6 倍。配套的 SN6000 系列交换机采用 102.4Tb/s 的 Spectrum-6 以太网 ASIC(专用芯片),配合 ConnectX-9 SuperNIC,每颗 GPU 最高可获得 1600Gb/s 带宽。面向多数据中心的 Spectrum-XGS,则把多站点 NCCL(GPU 之间同步数据的集合通信库)性能提高了 1.9 倍。

Scale-In:把机房杂务搬进独立硬件

GPU 集群要处理的不只是模型数据。用户访问、存储请求、身份验证、安全检测和监控流量同样消耗计算资源。英伟达推出的 Scale-In 被称为 AI 网络体系的第五大支柱:它由 BlueField-4 处理器和 DOCA 软件平台支撑,把多租户(多个客户共用一套设施)网络、存储访问、安全、资源配置和实时可观测性从主机侧分离出来,放进独立的硬件加速域,避免这些任务持续占用 CPU 和 GPU。

分工上可以这样理解:NVLink 解决机架内部的互联,Spectrum-X 解决机架之间的扩展,Scale-In 解决的是用户、数据和基础设施服务如何进入 AI 工厂。

谷歌、亚马逊、微软等云厂商近年纷纷自研 AI 芯片,这类芯片统称 XPU。过去,NVLink 只用于英伟达 GPU 之间的高速互连;NVLink Fusion 把这一能力延伸到第三方 XPU 和 CPU,让云厂商的自研芯片可以接入 NVLink、NVLink Switch 和 MGX 机架架构。

具体指标:第六代 NVLink 支持 72 个 XPU 的互连域,与基于通用以太网的替代方案相比,XPU 到 XPU 的端到端延迟降至三分之一,数据包速率提高 10 倍;NVLink-C2C 技术把 XPU 连接到英伟达 Vera CPU 或其他 CPU 时,能效最高可达 PCIe(主板通用扩展接口)的 6 倍,能缓解代理式 AI 系统在控制与计算之间的性能瓶颈。

对云厂商来说,接入后可以沿用 MGX 机架以及配套的供电、液冷、网络、管理软件和制造供应链,根据供应情况和工作负载,在英伟达 GPU 与自研 XPU 之间灵活切换芯片组合。英伟达把这一策略概括为纵向整合、横向开放——开放不是把 NVLink 变成完全独立的通用标准,而是允许第三方芯片进入英伟达定义的机架级体系。

一张路线图,也是一张考卷

把四项拼在一起,英伟达的路线已经清晰:Groq 3 LPX 负责低延迟的回复生成,NVLink 与 NVLink Fusion 负责机架内互联,Spectrum-X 负责跨机架扩展,Scale-In 负责安全、存储和运维。这套架构背后的判断是:未来 AI 系统的性能不由某一颗芯片单独决定,计算速度、Token 生成延迟、网络、存储、安全和运维必须被共同设计。

对英伟达而言,竞争边界已经从 GPU 扩大到整座 AI 工厂;对客户而言,真正的考验是基准测试中的成绩能否转化为可衡量的成本下降、稳定性提升和产出增长。AI 竞争正在从比单颗芯片参数转向比整座工厂的协同——这是此次披露背后最值得记住的判断。