大语言模型解数学题时,通常会生成多个候选答案,再从其中挑出正确的一个。挑答案这一步叫推理时验证(test-time verification),传统做法是让一个验证器把每个候选答案的文本重新读一遍、打分排序,重读文本让验证成为推理管线里成本很高的环节。2026 年 8 月 31 日提交到 arXiv 的论文 HSRM(Hidden-State Reward Models for Test-Time Verification,编号 2608.30841)给出了一条不同的路径:不重读答案文本,直接读取生成模型在推理过程中的内部状态(hidden states)。HSRM 只用约 2M 参数,就在 4 个数学推理基准、16 个生成器-数据集组合中的 15 个里达到或超过了 55M 参数的纯文本验证器。该论文已被自然语言处理领域的国际会议 EMNLP 2026 接收。
验证为什么会成为推理成本的大头
推理时验证的作用,是判断模型生成的多个候选解哪个正确。模型可以生成看起来合理的解题过程,但过程合理不等于答案正确,所以需要单独一层验证。常规验证器是纯文本的:每生成一个候选解,验证器就把这段文本从头处理一遍。候选解越多,重复处理的开销越大,这正是推理时验证被称为「昂贵环节」的原因。
一个已被观察到的现象:模型内部状态自带正确性信号
已有研究观察到,大语言模型的内部表征(internal representations)中编码着与正确性相关的信号:模型在生成过程中,常常「知道自己某个答案可能错了」。既然信号已经存在,验证就不必非要把文本重新读一遍。
HSRM 的做法:在推理步骤边界读取隐藏状态
HSRM 的核心是把上面这个现象工程化:
- 使用一个冻结的生成器(frozen generator)进行推理,在推理步骤边界(reasoning-step boundaries)提取隐藏状态;
- 用一个小型 Transformer encoder(约 2M 参数)对候选答案的隐藏状态排序;
- 训练数据来自模型自生成的轨迹和结果标签(outcome labels),不需要人工过程监督,也不需要大型预训练验证器。
验证所需的信号,是生成过程中已经计算出来的副产品,而不是额外的文本重读。
结果与对比:2M 对 55M
在 4 个数学推理基准上,HSRM 在 16 个生成器-数据集组合中的 15 个上达到或超过了 55M 参数的纯文本能量验证器(text-only energy verifier)。HSRM 的参数规模约为该验证器的 1/27,验证质量却基本持平。由于隐藏状态在生成时已经算出,HSRM 增加的验证成本主要来自那个 2M 参数的小编码器。
这件事对推理成本意味着什么
HSRM 的意义在于指明了一条降本路径:验证不一定非要重读文本,生成模型内部状态里已经带着正确性信息。对部署推理服务的一方来说,在数学、代码这类需要多次采样候选答案的任务上,推理时验证的边际成本有望明显下降。
论文信息:HSRM: Hidden-State Reward Models for Test-Time Verification,作者 Xianzhi Li、Xiaodan Zhu,arXiv 编号 2608.30841,2026 年 8 月 31 日提交,EMNLP 2026 接收。