AI 视频生成过去一年有一个明显短板:多数模型先出画面、再单独配音,画面与声音分开建模。人物口型对不上台词、音效与动作错位、单条成本居高不下,是创作者反映最多的三个问题。2026 年 8 月,字节跳动、Sand.ai、MiniMax、Black Forest Labs 四家公司密集发布新一代模型,四款模型都支持原生同步音频——视频与声音由同一个模型、同一次生成直接产出。

推动这次切换的有两件事:单流统一架构把画面和声音放进同一套建模过程,开源 MoE 模型把千亿参数视频模型的单条推理成本压到约 0.5 元。两者叠加,AI 视频第一次具备了低成本、可批量生产的基础。

问题出在先出画面、再贴声音

传统视频模型大多先出画面、再接配音:画面主干和音频主干分头建模,再靠 cross-attention(两条主干之间互相「查表」对齐声音与画面)或后处理把声音贴回去。链路越长,音画错位、口型漂移、环境声延迟越难根治。原生同步音频的做法相反——脚步落在正确的帧上,小提琴的运弓对得上音符。这不仅是体验优化,而是生成架构的切换。

同一个 Transformer 里同时出画面和声音

单流架构的思路是:文本、图像、视频、音频从第一层起就进入同一个 Transformer,在每一层 self-attention(同一层内各个片段互相「照应」以便对齐信息)中彼此交换信息,画面、口型、动作、环境声由同一套表征共同生成。多流方案把画面、声音交给不同主干网络、靠后处理拼接,链路越长,延迟与误差越容易累积。

四款模型各自把这条思路落到产品:

字节跳动的 Seedance 2.5 沿用统一多模态音视频联合生成架构,7 月 31 日发布,单段原生直出时长从 15 秒提升到 30 秒,多轮延长累计可达 60 秒,时间戳控制精度可达 1 秒以内,单次最多参考 30 张图片、10 段视频、10 段音频共 50 项素材。

Sand.ai 的 MAGI-2 Preview 采用单流架构,8 月 5 日发布并开源,文本、视频、音频进入同一个 Transformer 共同生成。

Black Forest Labs 的 FLUX 3 是其首款多模态基础模型,视频与音频在同一生成过程中产出,最长 20 秒,同时覆盖图像与机器人动作预测。

MiniMax 的 H3 支持 2K 分辨率与原生立体声,7 月 31 日发布并开源。

开源 MoE 把千亿参数模型的成本打到 0.5 元

MAGI-2 Preview 是这轮发布里值得单独拎出来看的一个。据 Sand.ai 称,它是全球首个千亿级开源 MoE 视频生成模型,总参数约 114B,单次推理仅激活约 6B。它的核心逻辑是「参数容量大、每次只用到一小部分,所以推理便宜」:采用超细粒度 MoE,把 3072 维隐藏表示拆成 12 个 256 维 Head,36 层主体网络中每个 Head 含 256 个专家、每次选 6 个,单 token 仅激活 72 个小专家,再用 Head Parallel 降低跨设备通信开销。

按 Sand.ai 测算,以 8 卡 H100 月租折算,蒸馏后生成 10 秒 1080P 视频的推理成本约 0.5 元,约为行业同类主流模型成本的 1/10。这意味着千亿级视频模型第一次有了中小企业与独立开发者跑得起的可能,权重与训练、推理代码已在 GitHub 与 Hugging Face 开源。

对比之下,闭源模型在冲更长单段时长:Seedance 2.5 单段 30 秒、可延至 60 秒,FLUX 3 最长 20 秒;开源模型在冲更低成本。

各家落点不同

在这轮发布中,各家的节奏不一样。Seedance 2.5 已上线即梦 AI、豆包专业版,火山方舟 API 将于近期开放。MiniMax H3 上线三天即在 Design Arena 的图生视频、多图生视频、视频编辑三类登顶,并三天登顶 Hugging Face 热度榜全球第一,按量付费 API 约 0.13 美元/秒(2K)。FLUX 3 仍处于早期访问阶段,通过 BFL API 与少量合作伙伴开放,官方计划年内发布 FLUX 3 Dev,其自报偏好胜率对 Runway Gen-4.5 约 77%、对 Luma Ray 3.2 约 93%,这一数据尚未经独立验证。

创作者怎么做选择

面对密集发布,可以按三条标准判断,而不是追着每一个新名字跑。

看音画是否原生同生。做口播、短剧、产品演示,优先选原生同步音频的模型,Seedance 2.5、FLUX 3、MAGI-2、H3 均属此列,可以省掉后期配音对齐的硬伤。

看成本与可控性。要可控分镜、长叙事,Seedance 2.5 的 30 秒时间戳分镜更直接;要低成本批量生产,MAGI-2 的 0.5 元/10 秒与开源权重更适合私有化部署。

看可用性状态。FLUX 3 仍是早期访问、未公开权重,生产环境暂不宜押注;MiniMax H3 与 Seedance 2.5 已有可用 API,适合先接入验证。

2026 年 8 月的这四款发布,共同完成了一次升级:音画从拼接走向同生,开源模型把千亿级推理成本降到单条视频几毛钱。对创作者来说,真正的变化不是某个新模型的名字,而是选择权变多了——可以按音画原生性、成本与可控性、可用性三条标准,组合出适合自己的生产管线。接下来值得留意的,是 FLUX 3 Dev 的开放节奏,以及 MAGI-2 生态能否在开源社区里继续降低部署门槛。