2026 年 8 月 25 日,Hot Chips 大会上,OpenAI 硬件负责人 Richard Ho 公布了首款自研推理芯片 Jalapeño 的第一份公开跑分。在 SemiAnalysis 的 InferenceX 基准测试中,这颗与博通联合打造的芯片,在每瓦吞吐量、低延迟生成速度两项关键指标上双双超过英伟达 Blackwell 系统。这是头部模型厂商自研芯片第一次拿出可对照的成绩单,芯片行业运行了二十年的默认秩序「为芯片适配模型」,开始向「为模型造芯片」翻转。
这颗芯片的来历
Jalapeño 由 OpenAI 负责架构设计,博通参与实现、网络与连接,Celestica 负责板卡与机架集成。它的额定功耗 700W,搭载 HBM4,单封装内存带宽约 15.4TB/s,B0 版 MXFP4 理论算力 13.4 PFLOPS。
从初始设计到完成流片,Jalapeño 只用了 9 个月。如果从 2025 年 10 月 OpenAI 与博通官宣合作算起,到今天拿出第三方见证的完整跑分,不到一年。作为对比,行业常规节奏是:一颗高性能 ASIC 从架构定义到流片通常需要 18 到 24 个月,谷歌 TPU 和亚马逊 Trainium 的第一代都走了两年。
9 个月流片,AI 在加速芯片本身
压缩研发周期的主力是 AI 本身。据 OpenAI 介绍,在 GPT-OSS 的部分 attention 和 MoE 模块中,AI 生成的 kernel 比人工专家编写的版本快 1.5 至 1.8 倍;借助 Codex 和 GPT-Astra,OpenAI 只用了约两个月就完成对 DeepSeek R1 和 Kimi K2.5 的移植与优化。
跑分用的是 A0 版工程芯片,改进版 B0 已进入台积电 N3P 工艺制造,第二代芯片进入深入开发,第三代开始规划。当研发周期从 24 个月压到 9 个月,「一年一代」的迭代节奏对模型厂商来说不再是老牌芯片巨头的专利。
跑分成绩:三项关键对比
在 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T 三款公开模型上,测试结果如下:
- 每瓦吞吐:Jalapeño 峰值是英伟达系统的 1.5 至 1.9 倍,用同样的电量多干近一倍的活;
- 低延迟生成:跑 DeepSeek R1 时单用户生成速度最高约 700 token/s,英伟达 GB300 约 169 token/s,快 4.9 倍,等待时间缩短近四分之三;
- 大模型更占优:万亿参数的 Kimi K2.5 上最低延迟 1.56 秒,对手 5.31 秒;把交互速度固定在 100 token/s/用户时,Jalapeño 的每千瓦吞吐是 GB300 的 9 倍以上。
GPT-OSS 120B 的数据同样直观:每千瓦每秒处理约 8.54 万个 token,单用户每秒最高生成 1459 个 token,对手为 535 个。
设计哲学:少搬数据
Jalapeño 的架构选择围绕一个痛点:大模型推理的瓶颈不在算力,而在每生成一个 token 都要把模型权重和 KV 缓存从内存搬进搬出。通用 GPU 的算力单元大半时间在等数据,这是很多芯片纸面峰值高、实际负载只能发挥六七成的根源。
Jalapeño 的做法是把计算核心与 HBM4 内存切成对应「切片」,每个核心对属于自己的内存有低延迟直达通道;模型生成时要反复用的数据被显式放置并保持在本地,省掉来回搬运。
另一个关键选择是:prefill(处理输入)和 decode(逐 token 生成)由同一颗加速器完成,而不是像英伟达 Rubin 那样拆给专用 CPX 芯片。OpenAI 的理由是真实流量构成一直在变——聊天、推理模型、Agent 的输入/缓存/输出 token 比例已经面目全非,按固定比例配两种芯片,流量一变就有一半闲置。
成绩单的水分,原文并未回避
这份跑分有明确的保留项:数据主要由 OpenAI 提供,SemiAnalysis 只是到实验室现场见证运行,并未独立完成全部测试;公开结果全部来自约 8k 输入、1k 输出的单轮推理,这是相对容易调优的负载;对更长上下文、多轮交互的智能体任务,OpenAI 一个公开数字都没给——而 Agent 恰是当下推理需求增长最快的场景。
按计划,Jalapeño 2026 年底以「极小规模」部署,真正上量要等到 2027 年。跑分与量产之间,还有一整年的检验期。
跑分之外的野心:算力出租
这份成绩单里还埋着一门尚未宣布的生意。跑分中,DeepSeek R1 和 Kimi K2.5 两个竞争对手的模型拿到了与 GPT-OSS 完全同等的待遇——OpenAI 甚至从零实现了 DeepSeek 自研 MLA 注意力机制所需的底层核心计算代码。这超出了「证明芯片通用」的需要,更像在证明任何一家的模型都能在这颗芯片上快速跑到最优。
如果 Jalapeño 的每 token 成本确实比英伟达更低,OpenAI 完全可以像云厂商卖算力那样,把推理能力租给其他模型公司。OpenAI 至今未就此公开表态,但一家公司的长远野心,往往最先出现在工程决策里。
48 小时,三条路线
Jalapeño 公布成绩单的前一天——8 月 24 日——英伟达宣布 Vera Rubin 机架级系统全面投产,并公布在 Artificial Analysis 基准下跑 Gemma 4 31B、10 万 token 长上下文场景每秒 3400 个输出 token,比最接近的竞品快 4 倍。同一天,苹果发布全球首款量产 2nm 芯片 M6,多线程性能较上代提升 40%,双 16 核神经引擎带来翻倍的本地 AI 算力,M5 Ultra 把 Mac 统一内存推到 512GB。
48 小时内三颗芯片,三条互不兼容的路线:苹果赌制程与端侧,把 AI 塞进本地设备、绕开云端按量计费;英伟达赌通用与系统,七颗芯片协同成一台机器;OpenAI 赌垂直与专用,把自家模型的需求直接硬化进电路,换取极致的每 token 成本。
算力这门生意,从一家公司的主导,变成了三种势力的博弈。模型企业第一次用自己的芯片、自己的考题、自己的成本结构,给出了另一个答案——「为模型造芯片」不再是一个口号,而是一条已经跑通、正在量产的路上。