2026年8月31日,一篇编号为 arXiv:2608.31035 的研究论文在 arXiv 上公开,系统测试了「用人类主观感受当强化学习奖励」的做法在语音生成模型上是否成立,论文已投稿 EMNLP 2026。测试给出三条明确结论:每个主观奖励基本只提升它对应的那一项指标,不能互相顶替;Best-of-8 重排序在听感上不输给 GRPO 策略优化;用字符错误率(CER)区间约束可以有效防止模型靠转写漂移钻奖励的空子。

为什么语音模型需要主观奖励

Codec 语音 TTS 模型先把语音编码成离散 token,再按语言模型的方式生成语音,这让「语言模型后训练」这套方法可以迁移到语音生成上。但后训练需要奖励信号,而语音的「自然」「讨喜」「有表现力」都是主观感受,没有现成的客观指标可直接当奖励。

常见的替代方案是训练一个「感知预测器」:让模型学会预测人类对一段语音的打分,再拿这个预测当奖励。问题在于,预测器与真实人类听感是否对齐、能不能放心使用,此前缺乏系统性验证。这项研究就是围绕这个问题设计的实验。

实验设计:四类主观指标加一道防作弊闸门

研究者 Joonyong Park 和 Jerry Li 用 GRPO(组相对策略优化)配合学习得到的奖励,分别优化四类主观指标:动画式说话风格、自然度、讨喜度、唤醒度。

实验的关键设计是一道防作弊闸门——CER 区间约束。感知奖励存在一条捷径:模型可以改变发音方式去拉高预测器的分,代价是文本转写错误率上升,即「转写漂移」。把字符错误率限制在指定区间内,这条捷径就被堵住了。

对照组是 Best-of-N 重排序:生成多个候选,用同一个奖励门挑选最好的那个,策略本身不做优化。研究采用 Best-of-8 作为对照。

三个关键发现

发现一:主观预测器不可互换。 单奖励实验中,每个奖励主要只提升它自己的目标指标——优化自然度不会顺带把讨喜度拉高。这说明「自然度预测器」不能当作「讨喜度」的质量代理,选奖励时不能想当然。

发现二:奖励向人类听感的迁移不均匀。 多评分员 A/B 测试显示,不同奖励的迁移效果差异明显。奖励差距分析进一步把「平均迁移」和「逐轴校准」拆开看:带符号的奖励差距能显著预测听者的选择,而残余 CER 差距不能;但逐轴观察,各指标的校准情况并不一致。

发现三:Best-of-8 重排序在感知上不劣于 GRPO。 重排序是强的人类级基线,GRPO 并没有在听感上全面超越它。研究的解释是:GRPO 的价值在于把「奖励筛选出的行为」摊销进策略本身,而不是在所有指标上胜过重排序。

对实践的两点启示

对准备做语音模型后训练的团队,这项研究给出两个可直接使用的建议。

一是分析奖励时把主观语音奖励当作「预测器-轴-基底」三元组来考察,而不是笼统地看一个总分;二是在投入多奖励联合后训练之前,先用论文提出的奖励差距诊断逐项检查每个奖励是否值得入选。

核心结论:主观奖励各有各的效用边界,重排序并不输给策略优化,用 CER 约束堵住转写漂移是关键防线。 做多奖励语音后训练前先做一层校准诊断,比直接堆叠多个奖励更稳妥。