2026 年 8 月下旬,斯坦福大学基础模型研究中心(CRFM)主导的开放基础模型项目 Marin 启动了一款总参数 5350 亿的 MoE 模型训练。与主流模型公司不同,这次训练从第一天起就全程公开:训练曲线、数据配方、模型配置、技术讨论,乃至中途的失败与修改记录,都实时发布在 GitHub 与 W&B 上。项目负责人、斯坦福副教授 Percy Liang 在 x 上的宣布帖浏览量突破 80 万,吴恩达转发并称其为捍卫 AI 开放性的「珍贵示范」。

Marin 535B-A23B 是什么

535B-A23B 是一款混合专家(MoE)模型。「535B」指总参数约 5350 亿,「A23B」指每处理一个 Token,实际参与计算的参数约 230 亿。它并非让全部参数同时工作,而是由路由模块判断输入内容后,把 Token 分配给一部分专家网络,这也是 MoE 近年来重回主流的原因:总容量可以继续扩大,单个 Token 的计算成本不必与总参数量同步增长。

按公开计划,模型将处理 18.75 万亿 Token,其中约 80% 用于预训练、20% 用于中期训练;训练运行在 11 套 NVIDIA GB200 NVL72 集群上,预计持续约 3 个月,总计算量约 2.7×10²⁴ FLOPs,之后进入后训练阶段。每套 GB200 NVL72 由 72 颗 Blackwell GPU 与 36 颗 Grace CPU 组成机架级 NVLink 域,正是为跨卡通信密集的 MoE 训练设计。

开放实验室:把失败也公开

Marin 提出的「开放实验室」机制,与此前开源模型的发布方式有本质区别。每个实验先通过 GitHub Issue 声明目标与假设,具体配置以代码和 Pull Request 提交,外部研究者可以参与 Review;实验启动后,W&B 训练指标公开。更重要的是,所有成功、失败和中途修改的痕迹都被记录,数据、代码、配方及最终模型持续开放。

项目发起公告的作者包括 David Hall、Percy Liang 以及来自斯坦福、Open Athena 和开源社区的多位研究者,项目最早于 2025 年 5 月对外公布。在 535B 之前,Marin 已训练过 8B 和 32B 模型。

MoE 训练的两大难点:Token Dropping 与专家并行

MoE 的工程难点不在把模型切到更多 GPU 上,而在通信与负载均衡。不同 Token 会被路由到不同专家,而专家往往分散在不同 GPU 甚至机架上,系统需要先做一次 All-to-All 通信把 Token 送到对应专家,算完再送回原路径。一旦某几个专家收到的 Token 过多,就会出现「热点专家」,训练框架只能为专家设定容量上限,超出的 Token 被直接丢弃,这就是 Token Dropping。

Marin 团队披露,此前的实验中,上下文长度从 4K 扩展到 65K 时,Token Dropping 比例从约 7% 升至约 40%。原因是上下文越长,一个批次里的独立序列越少,Token 分布越不均衡。因此 535B 没有一开始就追求超长上下文,而是退回 4K 上下文启动预训练;配合团队自研的 pooled/wave 专家并行方案,4K 上下文下 Token Dropping 降至约 3%,但团队明确承认这套实现仍属实验性质。

训练栈方面,Marin 基于 JAX、XLA 和 Levanter 构建。此前 8B、32B 主要跑在 Google TPU 上,本次 535B 转向 NVIDIA GB200 NVL72,团队因找不到 JAX/XLA GPU 环境下性能足够的现成方案,手写实现了专家并行(Expert Parallelism),其性能高度依赖 All-to-All 通信与专家计算的有效重叠。

缩放梯:用小型模型为 535B 提前探路

Marin 没有把全部算力直接押在 535B 上,而是先训练了一组规模递增的 MoE 模型形成四级「缩放梯」:从 1.6B 总参数、61M 激活参数,逐级扩大到最高 27.7B 总参数、约 1.2B 激活参数。这套实验只占最终计算量的约 1%,却承担三项关键任务:预测 535B 各阶段应达到的损失水平;提前暴露训练稳定性问题;区分正常波动与失控前兆。

缩放实验已经发现过一个实际问题:随着 Token 训练周期拉长,梯度范数一度增长到 4 以上,若不处理,训练可能在中途完全发散。团队最终加入 logit z-loss,通过惩罚过大的 logit 归一化项降低数值不稳定风险。

不是第一个直播训练的项目

Marin 并非首个公开训练过程的大模型项目。2022 年,Hugging Face 牵头的 BigScience 就在训练 1760 亿参数的 BLOOM 期间公开 TensorBoard 日志,持续披露训练进展与系统故障;此后的 Pythia、LLM360 和 Ai2 的 OLMo 系列也开放了训练数据、代码、日志与中间检查点。Marin 的发起公告明确列出 EleutherAI、AI2、Hugging Face、BigScience、BigCode、LLM360 等先行项目,并称希望「再向前一步」。

它真正不同的地方,是把开放从「一次模型发布行为」扩展成「实验室的默认工作方式」:不是等训练完成后再开放整理过的材料,而是从提出假设、提交代码到训练失败都尽量实时公开。

现阶段最重要的产出是训练记录

5350 亿总参数、18.75 万亿 Token、2.7×10²⁴ FLOPs 表明 Marin 535B 已进入非常大规模的训练区间,但这些数字不能直接证明它会成为前沿模型:MoE 的 535B 不能与 535B 稠密模型等价,预训练损失也不代表代码、数学、Agent 等能力,且项目仍处训练早期,不排除因系统或数据问题调整路线。

对无法承担同等算力的研究团队来说,复现整个 535B 并不现实,但它沿途留下的训练记录可以被其他规模的模型复用:专家如何路由、Token Dropping 如何变化、梯度何时异常、长上下文如何扩展、JAX 如何在 GB200 上实现专家并行。如果这次训练最终成功,开放社区将获得一套少见的大规模 MoE 训练样本;如果中途出现问题,公开的故障路径同样具有研究价值。这场实验值得持续关注的,是它能否证明:大模型的训练过程,可以像开源软件一样被公开审视和共同建设。