2026 年 8 月底,一家名为自变量机器人的中国创业公司发布了一款叫 WALL-SS 的「世界模型」,并公开了论文和全部代码。这家公司做的是「具身智能」——让 AI 拥有身体,能感知并操作物理世界。WALL-SS 的作用是给机器人建一座虚拟训练场:机器人先在虚拟环境里把动作预演一遍,看看会不会抓空、碰倒东西,再决定真机怎么干。论文给出的对照数据是这件事最值得关注的地方:600 组虚拟与真机对比实验中,虚拟世界里选出的较优动作方案,有 89% 与真机测试的优劣判断一致。也就是说,机器人的「梦」第一次能拿来筛选真机动作,而不是看完就忘的动画片。
世界模型:机器人脑中的预演系统
什么是世界模型?它是机器人脑中的预演系统:输入当前画面和一组准备执行的动作,它预测接下来会发生什么——机械臂往左移 1 厘米,杯子会被抓住还是被碰倒;抽屉开着,下一步是取物还是先调手腕角度。机器人可以同时比较多个「未来」,再选最稳的一条。这件事之所以重要,是因为真实世界没有固定跑道:杯子被人挪了一点、桌面多出一块抹布,训练好的动作就可能失效。在真机上反复试错既花钱又有风险,能在虚拟世界先筛一遍,就成了机器人行业降低试错成本的关键。
过去的世界模型为什么不可靠
但过去不少世界模型并不可靠。训练数据大多来自成功示范,模型容易走捷径:看到夹爪闭合就默认物体被抓起来了,哪怕中间还有空隙,生成画面里的物体也会自动「贴」进夹爪——论文把这种错误叫做「磁铁式抓取」。推演时间一长,误差还会不断累积,物体越偏越远;只留最近几帧会失忆,全留又撑爆显存。更要命的是,虚拟画面再逼真,也不代表选出的策略(机器人执行任务的动作方案)在真机上真的更好。WALL-SS 要突破的正是这三点:动作是否真正改变结果、长任务能否保持连贯、虚拟成绩是否经得起真机检验。
WALL-SS 的三招:分层生成、摘要记忆、带错训练
WALL-SS 的解法有三招。第一招叫「下一尺度自回归」:「自回归」就是按顺序一段接一段地预测,先看已发生的、再推下一步。WALL-SS 预测画面时先搭一版低清预览定大方向——手臂往哪走、物体大概怎么动——再逐层调清,补上物体轮廓、夹爪开合和接触位置,每清晰一层,动作就再影响一次未来。第二招叫「尺度压缩的长时间跨度记忆」:像一份会自动整理的工作记录,刚发生的动作保留细节,更早的历史压缩成摘要,既不「断片」也不必背下每一帧。第三招叫「逐尺度梦境强迫」:训练时故意给历史信息加入扰动,要求模型在带错的信息上预测正确未来——相当于让机器人平时就在「有小错误的梦」里继续走,学会别把小错滚成整段崩溃。
评测数据:动作敏感度与轨迹精度领先
评测数据上,衡量「画面是否随动作改变」的动作敏感度,WALL-SS 得 0.290,英伟达的对比模型 Cosmos 3 只有 0.044,其余模型为 0;衡量「生成机械臂是否沿给定路线走」的轨迹精度,WALL-SS 得 0.539,是全部对比模型中的最高分。连续推演 60 秒的倒水和物品整理任务里,逐帧轨迹误差保持在画面对角线长度的 0.5% 以下。去掉「梦境强迫」训练后,长期状态一致性持续下降;只保留最近片段的简化版本,在 20 至 30 秒后开始明显恶化——这些消融实验说明,WALL-SS 的长时间连贯来自方法本身,而不是视频看上去顺眼。
虚拟与真机对照:600 对实验、89% 一致
虚拟成绩与真机是否一致,团队做了对照实验:把 5 个不同训练阶段的策略、6 项任务、20 组匹配初始状态,分别放进 WALL-SS 和真实机器人执行,共得到 600 对闭环结果。其中 527 对最终成败一致;虚拟世界里选出的较优版本,有 89% 的优劣关系与真机测试相同;30 个「任务×策略版本」组合的成功率对比,虚拟与真机结果的相关系数为 0.926,平均绝对误差为 0.062。这里的 0.926 衡量的是两组结果的整体变化趋势一致,不能理解成单次预测有 92.6% 的命中率。团队的态度也很克制:世界模型不必取代真机测试,能先筛掉明显更差的策略版本,就已经省下大量现实试错——这像汽车碰撞仿真,不会取消最后的实车碰撞,但能少撞几台真车。
从分拣直播到虚拟训练场
这不是自变量机器人第一次把机器人往真实场景里推。此前它发布的 WALL-B 双臂机器人在一次物流分拣直播里,用标准夹爪处理纸箱、软袋、圆柱形快件和泡沫封装生鲜等随机包裹,完成了 1911 件有效分拣,准确率超过 98%。WALL-SS 让这类机器人上工位前先在虚拟世界检查:会不会抓空、会不会碰撞、连续作业会不会逐渐跑偏——对按吞吐量和停机时间算成本的仓库,这套虚拟筛选有机会减少设备占用和现场复位。
王兴兴的 80/80 判断:具身智能的「ChatGPT 时刻」
行业里对「机器人什么时候真正走进生活」也有一个参照:宇树科技创始人王兴兴最近判断,具身智能的「ChatGPT 时刻」——机器人能在约 80% 的陌生场景中,仅靠语言或文字指令完成约 80% 的任务——快则 2 至 3 年,慢则 5 年甚至 10 年。WALL-SS 还没有把机器人直接带到这个阶段:论文的真机实验集中在桌面双臂任务,连续推演验证时长是 60 秒。但它指出了一个更现实的方向:让机器人学得更便宜、测得更可靠,再走进更多陌生环境。
可以带走的判断
这篇文章最后可以带走的一个判断是:当世界模型能预测真机策略的相对优劣时,它就不再是生成演示视频的工具,而成了机器人研发系统的一部分——虚拟训练场同时兼任练习场、考场和校准台。下一轮具身智能竞争,比的是谁能让机器人少摔杯子,而不是谁多拿几块赛场金牌。