华为在 2026 年 8 月发布了新一代 AI 芯片昇腾950。它是一款专门用于训练和运行大模型的国产 AI 芯片——AI 芯片就是为人工智能计算专门设计的处理器,大模型(用海量文本训练出来、能理解和生成文字的 AI 程序)的训练与推理都要靠它。昇腾950 的意义在于:国产大模型厂商在高端芯片上长期依赖进口,昇腾950 用 804 TFLOPS 的 FP8 算力(TFLOPS 是衡量芯片计算速度的单位,1 TFLOPS 约等于每秒一万亿次浮点运算;FP8 是 AI 计算常用的一种数值精度格式)和可扩展到千卡规模的组网能力,把国产算力向「能撑起大模型训练」再推进一步。

两款型号,统一 804 TFLOPS 算力

昇腾950 系列分为 950PR 与 950DT 两个型号。据《昇腾950 NPU 架构白皮书》,两者都采用第三代 DaVinciCore 架构——DaVinciCore 是华为自研的 AI 计算核心,相当于芯片的计算引擎。950PR 与 950DT 的 FP8 算力均为 804 TFLOPS,差异主要在显存配置(显存是芯片临时存放数据和模型权重的高速内存):

  • 950PR:显存容量 112GB 或 128GB 两种规格,显存带宽 1.4TB/s 或 1.6TB/s(带宽指芯片每秒能读写多少数据);
  • 950DT:显存容量 96GB 或 144GB,显存带宽最高 4TB/s。

芯片内部,单颗昇腾950 把 2 个 AI Die、2 个 IO Die 与 8 个(950PR)或 4 个(950DT)高速片上内存模块合封在一起(Die 是芯片内部的功能单元,合封就是把它们封装进同一颗芯片,缩短通信距离)。

性能层面,昇腾950 新增 HiF8、MXFP8、MXFP4 三种低精度格式,张量核心(专门做矩阵运算的计算单元)浮点峰值算力提升到上一代的 4 倍,向量核心(负责非矩阵类计算)的 FP32 与 FP16 单核算力提升 100%。针对大模型训练中最关键的 FlashAttention 算子(注意力机制的计算组件,是大模型理解句子的核心环节),昇腾950 做了深度硬件优化,单核性能比上一代提升 1.5 到 2 倍。

千卡超节点:把许多芯片连成一台「超级计算机」

单颗芯片再强,训练大模型也需要成百上千颗芯片协同。昇腾950 用自研的 UB 高速互联协议(芯片之间传输数据的高速通道标准)把多颗芯片连成「超节点」——超节点就是把成百上千颗 AI 芯片通过高速网络组成一个整体,让它们像一台超大型计算机那样协同工作。搭配 UB Switch(超节点内部的交换设备),昇腾950 可以组建多达千卡规模的超节点集群;UB Switch 还提供从 UB 到以太网(Ethernet,最常见的计算机网络标准)的转换能力,可以直接接入现有标准以太网交换机,降低组网门槛。

超节点的规模效应有实测数据。据《超节点发展报告》,以昇腾384 超节点(384 颗芯片组成的集群)为例,相比传统服务器架构:通信带宽提升 15 倍,单跳通信时延(数据在芯片间传送一跳所需的时间)从 2 微秒降到 200 纳秒,降低 10 倍;在 DeepSeek、Qwen 等多模态与 MoE 模型上(MoE 即混合专家模型,把一个大模型拆成多个擅长不同任务的「专家」子网络、按需调用),整体性能提升可达 3 倍以上。

对国产算力意味着什么

昇腾950 的发布带来两个直接变化。其一,国产大模型厂商有了比上一代强得多的训练与推理选择,参数规格全面升级会加速国产 AI 大模型的迭代;其二,千卡超节点的商业化落地会提高国产芯片的性价比——同样的预算能组出更强的算力集群,从而带动国产算力芯片需求增长。东方证券 8 月 25 日的通信行业研报判断,国产大模型的加速迭代将驱动国产算力与交换芯片需求高速增长,并点名寒武纪、海光信息、盛科通信等产业链公司(研报观点,不构成投资建议)。

昇腾950 用 804 TFLOPS 的单卡算力和千卡级组网能力,把国产 AI 芯片的「单卡性能」与「集群规模」都推上新台阶,国产大模型训练算力对进口芯片的依赖正在被逐步拆解。