机器人正在越来越多地靠「看图打分」的大模型来学习技能,但这类模型有一个被新研究指出的隐患:对指令的措辞极其敏感,同一段动作换种说法,评分就可能从成功翻转为失败。

机器人训练里的「看图打分裁判」

先弄清两个基础概念。视觉语言模型(VLM,Vision-Language Model)是能同时处理图像和文字的人工智能大模型——给它一张照片加一句提问,它能答出画面内容。奖励模型(reward model,也叫奖励函数)是训练 AI 时负责打分的「裁判」:AI 每做一次动作,裁判根据表现打分,AI 再据此调整自己。把两者结合,就出现了一种成本更低的训练方式:用 VLM 当裁判,给它一段机器人的动作视频和一句文字指令(比如「把杯子放到桌上」),让它判断完成得怎么样。这样省去了人工逐个标注动作的环节,被越来越多的机器人团队采用。

换种说法,同一个动作就被判成另一个结果

问题在于,这个裁判对「同一个意思的不同说法」不稳定。研究者发现,仅把指令换成语义等价的措辞,同一段机器人轨迹(机器人执行的一组完整动作序列)得到的进度分数就会大幅变化;最极端的情况下,完全相同的动作会在「成功」与「失败」之间翻转。机器人什么都没做错,只是人给它的描述换了句话,它就被判成了不同的结果。

ROBORMBENCH:把隐患变成可量化的测试

为量化这一问题,研究者发布了 ROBORMBENCH 基准。基准是衡量模型能力的标准测试集。ROBORMBENCH 包含 2,390 条真实机器人轨迹——每条都带人工标注的「真实进度」作为标准答案——以及 21,673 条经人工验证的指令改述,覆盖词汇替换、句法改写、动作-目标改写三种类型。用这批数据测试多家专有(闭源商业)与开源 VLM 后发现:改述引起的不稳定普遍且严重;改写差异越大,评分波动越剧烈;把模型规模做大,或让模型显式「先推理再打分」,都无法可靠缓解。

专用奖励模型是目前更稳的选择

相比之下,用「轨迹接地」监督训练的专用奖励模型——即直接基于真实轨迹与标注数据专门训练出来的打分模型——稳定性显著更高。研究者因此建议:改述鲁棒性应成为选择与评估 VLM 奖励模型时的核心指标。对机器人开发者来说,这条结论有直接实用价值:训练裁判必须只对「做了什么」敏感、对「怎么说」不敏感,否则机器人会被互相矛盾的评分信号干扰,学出不稳定的行为。

这项研究由 Wonje Jeung 等人的团队完成,2026 年 9 月 4 日提交至 arXiv(全球最大的学术预印本平台,论文正式发表前先在此公开)机器人学板块,编号 2609.05401。