2026 年 9 月 7 日,彭博社援引知情人士消息称,字节跳动正在基于自家视频生成模型 Seedance,开发一款「实时空间视频生成模型」——也就是行业里常说的「世界模型」。创始人张一鸣亲自出面,协调跨部门团队和算力资源。按计划,该模型最快 10 月亮相,字节内部已给出直播、短剧、游戏三个落地方向,并计划与自家 VR 头显 Pico 打通:戴上头显,用户移动、转身、开口说话,眼前的画面会跟着动作同步变化。截至发稿,字节跳动未对这一报道作出回应。
字节跳动是运营抖音、今日头条等产品的中国互联网公司,旗下还有视频生成大模型 Seedance 和 VR 头显品牌 Pico。这家公司正把 AI 从「生成视频给你看」推进到「生成一个你能走进去的实时画面」,张一鸣为此重新下场。
字节跳动想做什么:把「刷视频」变成「走进视频」
过去几年,字节跳动的招牌是算法推荐——用算法把用户感兴趣的视频一条接一条推送到眼前,用户隔着屏幕观看。这次的新项目方向变了:不再只是生成一段等待播放的视频,而是生成一个能随用户声音和动作实时变化的虚拟环境。
举个例子:未来的直播里,主播可以站在一个 AI 实时生成的场景中;用户戴上头显后不再是旁观者,转头能看到场景的另一个角落,开口能和画面里的元素互动。短剧、游戏同理——故事场景不再提前录好或画好,而是由 AI 现场生成、随用户参与而改变。
「世界模型」是什么
世界模型,指让 AI 在内部建立一个关于现实世界如何运转的模型——物体怎么移动、光线怎么变化、用户动作会带来什么反应——然后用这个模型实时生成画面。普通视频生成模型是「给一句话,生成一段视频给你看」;世界模型更进一步,是「你动一步,画面跟着变一步」,画面与用户的实时互动是它的核心。
Seedance 和 Pico:这套系统里的两个关键角色
Seedance 是字节跳动的视频生成大模型——一种输入文字或图片就能自动生成视频的 AI 程序。新项目以它为基础,让「生成视频」升级为「实时生成可交互画面」。
Pico 是字节跳动旗下的 VR 头显品牌(VR 头显是戴在头上的显示设备,戴上后眼前呈现虚拟世界画面),字节跳动 2021 年收购了它。在这套系统里,Pico 承担「用户与虚拟环境之间的交互入口」:用户的移动、转头、说话,都由头显捕捉并传给系统,系统再驱动模型实时生成对应画面。
项目还依赖云端算力——算力即 AI 运算所需的大规模计算资源(服务器集群)。模型团队负责画面生成,云端负责大规模计算,Pico 负责交互,内容团队负责设计玩法,四者必须围绕同一种体验协同配合。
张一鸣为什么亲自下场
张一鸣是字节跳动创始人,2021 年先后卸任 CEO 与董事长职务,把管理权交给梁汝波,此后淡出日常管理多年,外界印象更多是「退休的创始人」。这次他直接介入一个具体项目,工作包括协调不同业务部门、调配 AI 资源与算力。
原因在于项目复杂度:它同时牵涉模型研发、基础设施与产品团队,任何一环单独拿出来,都不是用户最终拿到手的产品。内部需要一个能调动全公司资源的人统筹,这正是张一鸣亲自出面的意义。
投入与目标:2026 年 AI 优先事项的首位
据媒体此前报道,字节跳动为 2026 年设定了四项 AI 优先事项,世界模型位列首位,其余三项是:保持 Seedance 在视频生成上的优势、提升编码能力、推进豆包商业化(豆包是字节跳动推出的 AI 聊天助手应用)。
投入上,字节在世界模型方向的数据预算已达到八位数人民币(千万级),是中国其他竞争实验室的三到四倍;公司内部目标是在 2026 年底之前至少推出一款世界模型。
结论:一场从「观看」到「参与」的实验
彭博社将这一项目置于字节整体业务调整的坐标中:这家公司正把相当一部分业务转向视频制作与生成,战略意图从「让用户刷视频」转向「让用户走进画面」——过去的生成式模型帮创作者把内容做出来,这一次,字节想把观看内容的人也拉进画面,成为故事的一部分。
需要注意,截至发稿,这仍是彭博社援引知情人士的传闻,字节跳动未作回应,「最快 10 月亮相」也留有调整空间。但方向已经清楚:如果这套「世界模型+头显」的组合跑通,视频消费将从「隔着屏幕看」变成「走进画面玩」,这关系到字节跳动在下一代内容形态上的位置。