HSImul3R 是一套新发布的人–场景交互重建框架,用来解决“三维重建看起来对、用起来却不行”的问题,论文已被计算机视觉顶级会议 ECCV 2026 接收。 它由机器人公司大晓机器人联合新加坡南洋理工大学 S-Lab、上海人工智能实验室共同推出,能用一段普通视频(单个摄像头拍摄即可,不需要多相机阵列)重建出物理上真实可用的“人与场景”三维内容,并把成果迁移到了宇树(Unitree)G1 人形机器人上完成真机验证——人类视频由此成为机器人技能的新来源。
重建标准:从“视觉正确”到“物理成立”
三维重建,就是用照片或视频在计算机里还原物体与场景的立体形状,相当于给现实世界拍一张可以转动的“立体照片”。传统三维重建只追求“视觉正确”:人脸像、姿态准、场景齐。但机器人要面对的是真实物理世界,受重力、碰撞、摩擦支配。一个视觉上高度可信的场景进入物理仿真(用软件模拟重力、碰撞、接触等物理规律的运行环境)后可能立刻失效:椅腿结构缺失导致椅子站不住,人体与物体的模型互相穿插——这种“穿模”在真实世界永远不会发生。视觉上成立,不等于物理上成立,这是三维视觉领域长期存在的“感知–仿真鸿沟”。
HSImul3R 的做法,是把物理仿真从“最后打分的人”变成“重建过程中的监督者”:在重建进行时就不断用仿真反馈修正结果,形成物理闭环(Physics-in-the-Loop)的双向优化。
两路优化:仿真反馈直接参与重建
第一路,正向修人体。 用面向场景的强化学习优化人体运动。强化学习是让程序通过反复试错、按奖励信号调整行为的训练方法。这里的目标,是让重建出的人体动作既符合物理规律,又和当前场景保持正确的接触关系——“坐下”就是真的坐到椅子上,而不是在空间中比划一个相似的姿势。
第二路,反向修场景。 用直接仿真奖励优化(DSRO,Direct Simulation Reward Optimization)修正三维场景。仿真失败不一定是因为“人动错了”,也可能是场景本身没重建对,比如桌腿、椅腿这类细结构在图像生成三维模型时容易缺失或变形。DSRO 把“人与物体交互之后是否稳定”作为反馈信号,反向修正物体模型,评价标准从“物体自己能不能站稳”,升级为“人跟它交互之后还能不能稳定”。
HSIBench:把“能不能交互”变成可测指标
为了验证这套新标准,团队构建了人–场景交互基准 HSIBench:包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例,由 3 名参与者、每个案例从 16 个视角同步采集。
实验结果中,HSImul3R 在 Easy、Medium、Hard 三档任务的交互稳定率分别达到 53.68%、30.56%、13.92%,对比方法 HSfM 只有 10.52%、4.50%、2.66%;人–场景三维穿模率从 HSfM 的 69.51% 降到 22.90%。这些数字意味着,重建出来的世界能够承受机器人的真实动作与交互,而不只是看起来逼真。
真机验证:从仿真到 Unitree G1
成果没有停在仿真里。团队把经过物理优化的人体动作重定向到宇树(Unitree)G1 人形机器人,以这些动作作为先验,在仿真环境中训练全身控制策略,再直接部署到真实 G1 上,让机器人复现相应的人–场景交互。
至此跑通完整链路:人类视频 → 三维人–场景重建 → 物理仿真优化 → 机器人动作迁移 → 真实机器人执行。互联网上已有海量的人类行为视频,如果其中的人–场景交互能被持续重建、物理验证并迁移到不同机器人本体,这些视频就会从“给机器看的画面”,变成机器人学习真实物理技能的资产。
结语
这条路线仍处于早期:复杂交互、多物体场景和动态环境还有大量挑战。但 HSImul3R 给出了一个可以带走的判断:机器人从人类视频里学习的,不应只是“人看起来怎么动”,更应是“这个动作为什么能在真实物理世界中成立”。三维重建的评价标准,正在从“像不像”走向“能不能用”。