上周在海外匿名爆火的模型「牛来」(Ox Alpha),真身于 8 月 26 日正式确认:它来自智谱,是 GLM 系列首个原生多模态模型 GLM-5.3 Flash。这款模型总参数 320B、实际激活参数仅 18B,训练与推理全部跑在国产芯片上,并已面向全球开源。

在正式认领之前,海外开发者并不知道 Ox Alpha 的归属,只是觉得好用,一轮又一轮地把请求喂进去,硬生生把它推上了 OpenRouter 榜首。

匿名测试期间创下两项纪录

「牛来」在 OpenRouter 首日便冲上榜首,同时刷新单日 tokens 用量历史纪录;在 OpenCode 上,它终结了 DeepSeek 连续 56 天霸榜的纪录。据量子位实测,用同一段提示词让「牛来」生成 SpaceX Raptor 猛禽发动机的 3D 交互网页,效果比此前版本更精细,全程无需人工干预。

320B 总参数、18B 激活参数的架构设计

GLM-5.3 Flash 总参数 320B,实际激活参数只有 18B,层数从 GLM-4.5 时期的 92 层压缩到 45 层,配合 30T Token 多模态预训练语料,能力反而超越了体量 753B 的上一代 GLM-5.2。

关键改动在注意力机制:它采用线性注意力加稀疏注意力的混合架构,线性注意力抓局部信息,稀疏注意力通过轻量级索引器捞回全局上下文,面对 1M 超长上下文也不必让所有 Token 两两计算。智谱还新增 IndexPool,把索引器原本 4 个缓存向量压成 1 个。相比 GLM-5.3,注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍。

AA 榜单 57 分,价格只有 Opus 4.8 的四十分之一

根据最新 AA 榜单,GLM-5.3 Flash 得分 57 分,与 Claude Opus 4.8 持平,进入全球前沿序列。定价上,它是 GLM-5.3 的十分之一,限时折扣为二十分之一,是 Opus 4.8 的四十分之一,也低于 DeepSeek V4 Flash。

对 Agent 类长任务而言,这个价格的意义更直接:一次任务跑几十分钟、几个小时,Token 消耗量很大,模型能力再强,单价高也会让用户反复算账。GLM-5.3 Flash 把前沿能力的单价往下打,让前沿模型开始有了日常消耗品的意思。

62T Tokens 全跑在国产芯片上

训练与推理的 62T Tokens 全部由国产芯片承接。为了在国产加速芯片上扛住多模态与 1M 上下文,智谱把多模态编码、Prompt 预填充和逐 Token 解码拆成可独立调度、扩缩容的 Encode-Prefill-Decode 分离式架构,叠加 Layer Split、混合缓存量化等底层优化。相比同一套硬件上的初始基线,端到端服务性能提升 3 倍,单 Token 成本做到与主流英伟达 GPU 相当。

开源生态:模型、算力、权重一起开放

GLM-5.3 Flash 已正式开源(HuggingFace 仓库 zai-org/GLM-5.3-Flash),同时接入 ZCode、开放 API。模型跑在国产芯片上,权重直接打开,开发者拿得到,企业也能自部署。

这次事件的完整链条值得注意:模型是国产的,接住全球真实流量的算力也是国产的。过去前沿模型能力越强、调用越贵;GLM-5.3 Flash 把架构、推理和算力效率一起抠下来,再把开源生态接上。「牛来」这个名字由此有了双重含义——能干活,吃得少,而且牛是自己的,草也是自己的。