2026 年 9 月 8 日,英国芯片设计公司 Arm 在上海的年度活动 Arm Everywhere China 上,发布了面向智能体 AI 的第二代移动计算平台 CSS for Mobile 2。这套平台把 CPU、GPU、系统互连和配套软件打包成一套开箱即用的「计算底座」,手机厂商可以直接拿它做基础,再叠加自己的差异化设计。
先说清 Arm 是谁、它的动作为什么值得关注。Arm 自己不制造芯片,而是把芯片设计方案(即架构)授权给全球厂商——苹果、高通、联发科、华为等几乎所有主流手机处理器的底层都出自 Arm。据官方数据,基于 Arm 技术的芯片累计出货量已超过 3500 亿颗。这个基数意味着,Arm 每调整一次技术方向,都会传导到海量终端设备上。
CSS for Mobile 2 被称为「为智能体时代打造」,是因为手机要干的活变了。智能体(agent)指能理解用户意图、自己规划步骤、替用户执行任务的 AI——比如对手机说「帮我订下周去北京的机票和酒店」,它能自己拆解任务、调用相应应用完成。这类应用让手机的计算从「回答一个问题」变成「独立跑完一整套流程」。
Arm 认为,这套流程快不快取决于三个维度:各任务阶段的执行速度、数据在不同计算引擎之间的传输效率、系统对全流程的协同调度。CSS for Mobile 2 的每一项升级,都对应着这三个维度。
CPU 重新定位:从「算得快」到「管得好」
CSS for Mobile 2 的核心是新一代 C2 CPU 集群,由 Arm 迄今最强的移动 CPU C2-Ultra、主打能效的 C2-Pro 和两个 SME2 引擎组成。
SME2 可以理解为给 CPU 装的「AI 加速指令」:让负责通用计算的 CPU 也能高效运行 AI 常用的矩阵运算。上一代平台上 SME2 引擎只有一个,这一代增加到两个,矩阵算力直接翻倍。对应实际数据:最新 AI 模型在 C2 集群上性能最高提升 1.7 倍,单线程性能(普通应用场景的代表指标)提升 15%,相同性能下功耗最多降低 38%。
具体到智能体场景:跑语音转文本模型(把语音转成文字、让助手「听懂」的环节)时,C2-Ultra 比上一代延迟降低 40%;记忆阶段的内存检索性能提升 41%;推理阶段小语言模型生成指令的平均速度提升 25%。把各环节串起来,整条智能体工作流性能提升 24%。
更关键的是 CPU 的角色转变。Arm 将 CPU 重新定义为系统的「编排引擎」:维护任务状态、整合上下文、决定工作流的每一步交给本地应用、端侧模型还是云端服务。用采访中 Arm 高管的说法,过去十年行业比的是算得快,而智能体时代 CPU 看重延迟而非峰值——一味追峰值反而可能拖累响应速度。
这方面的背景是:当前旗舰手机的 NPU(专门加速 AI 计算的处理单元,厂商宣传的「AI 算力」指的就是它)算力约 100 到 200 TOPS(TOPS 是每秒万亿次运算),而搭载 SME 的 CPU 集群等效算力约 5 到 6 TOPS。在 Arm 的规划里,CPU 的战场是装得进手机本地算力预算的小语言模型,计算密度极高的负载仍交给 GPU 或 NPU。
C2 集群最高支持 14 个核心,合作伙伴可按需选择——有厂商评估后认为智能体工作负载至少需要十个核心。平台同时支持 2 纳米等更前沿的芯片制造工艺,为未来留出性能空间。
GPU 首次「AI 原生」:把神经网络嵌进着色器
GPU(图形处理器,负责屏幕画面渲染的芯片)部分,Arm 发布了 Mali G2-Ultra NX,这是首款「AI 原生」的 Mali GPU。最大变化是把专用神经网络加速器直接嵌入了 GPU 的着色器核心(每个负责计算画面像素颜色的小处理单元),让神经图形工作负载可以和传统图形、计算任务并行运行,同时复用 GPU 的内存系统,减少数据搬运。
这套技术用的是卷积神经网络(CNN,一种擅长处理图像的神经网络),而不是大语言模型那种架构。它不从零生成画面,而是从 GPU 渲染出的真实画面出发,做超分辨率和细节补全。
Mali G2-Ultra NX 支持三项神经网络加速技术:神经超级采样 NSS(从低分辨率画面重建高分辨率图像)、神经帧率提升 NFRU(生成中间帧来提高帧率)、神经超级采样与降噪 NSSD(把超分和降噪结合,面向复杂光线追踪场景)。
效果在 Arm 与游戏工作室 Sumo Digital 联合打造的演示游戏《光影新生》中得到展示:NFRU 与 NSSD 相比传统渲染,性能效率最高提升 4 倍,外部内存流量最多降低 70%——在手机上渲染同样画面所需的带宽与能耗大幅下降,让原本很难运行的光线追踪特效(模拟光线真实传播、画面更真实但计算量极大的渲染技术)得以在移动端实现。
传统图形性能同样有升级:执行引擎是 Mali 过去七代产品中规模最大的指令集架构升级,每个线程束的寄存器数量是上一代的 2 倍;第三代光线追踪单元对不透明度微贴图提供硬件级支持,帧率最高提升 30%,光线追踪工作负载最多降低 70%。综合基准测试性能最高提升 24%,非 AI 游戏性能最高提升 14%,支持最高 120 帧每秒的稳定运行。
对比桌面端帧生成技术,Arm 方面表示手机受限于功耗和散热,必须做专门的架构优化。他们的另一个特点是开放:AI 模型开放给厂商,手机厂商验证后可进一步优化定制。Arm 近期还宣布与腾讯游戏合作,共同探索神经动态全局光照等未来技术。
生态:3500 亿颗芯片的底座,加软件与伙伴
CSS for Mobile 2 的基础来自 Arm 的生态。除了累计出货超 3500 亿颗芯片,Arm 还有全球超过 2200 万人的开发者社区,通过 KleidiAI 与主流 AI 框架深度集成,开发者不改变现有流程就能用上 SME2 等底层能力。
产业合作已经落地:支付宝、OPPO、vivo 与 Google AI Edge Gallery 已采用 SME2 技术;神经网络图形方面,网易《燕云十六声》计划今年推出支持神经超级采样的版本,腾讯《暗区突围:无限》开展神经超级采样与降噪演示,叠纸游戏《无限暖暖》推进神经超级采样集成;腾讯游戏公共技术线 MagicDawn 和 Unity 中国团结引擎,已把 Arm 神经网络技术集成进开发流程。
手机之外,Arm 正把生态能力延伸到「物理 AI」领域(把 AI 放进机器人等实体设备中),联合 AWS、Hugging Face、Liquid AI、QNX 等 80 多家企业,首项动作是构建机器人能力分级框架——建立一套统一语言来描述和评估自主机器的能力水平。
结论:手机芯片竞争的焦点变了
CSS for Mobile 2 的意义不在于单个性能数字,而在于把智能体时代的计算需求拆解成一套可交付的技术方案:CPU 从「专注算得快」转向「统筹管得好」,GPU 第一次把神经网络纳入原生架构,整条链路为一整套任务流程而非单次运算做优化。
可以预期的行业变化是:手机芯片的竞争重心,正从 NPU 的峰值算力(TOPS 数字)转向延迟、内存与系统级调度能力。对普通用户,这些变化最终会体现为更自然的语音助手、更流畅的 AI 功能,以及画质更好的手机游戏。
这套平台的落地进度仍有待观察——首批搭载 CSS for Mobile 2 的旗舰机何时上市、纸面数据能否兑现,需要时间验证。但方向已经明确:智能体时代,手机里的计算平台正在被重新设计。