研究计划没有标准答案,这是 AI 科学家训练中最棘手的问题之一。9 月 1 日提交至 arXiv 的论文《PaperGym: Rubric-Centered Evolution for Research-Plan Generation》(编号 2608.31119)给出一个新思路:把每一篇科研论文改造成一个完整的训练环境,让模型在真实的论文结构上练习生成研究计划。论文报告,评判标准泄漏率从现有数据集的 11.90%-34.10% 降至 3.7%;训练后的 Qwen3-8B 在研究规划基准 ResearchQA 上拿到 73.48 分,超过参数规模大得多的 Kimi K2.6。
强化学习缺少训练环境
研究计划属于开放任务,没有可验证的标准答案,强化学习因此缺少它最依赖的结构——把任务和批评者配对的环境。论文的做法是从论文里找批评者:一篇论文的摘要、方法与实验,本身就是对「研究问题 + 解决方案」的完整记录,可以充当判卷标准。
旧管线的两个缺陷
此前的研究计划数据管线有两点不足。第一,研究问题和评判标准从同一份内容里抽取,模型只要改写措辞就能拿到奖励,训练信号因此失真。第二,评判标准(rubric)被压缩成每轮 rollout 一个标量,信息损失严重。两个问题叠加,模型学到的是「怎么说得像」,而不是「怎么想得对」。
问题与标准分离
PaperGym 利用论文的固有结构做拆分:研究问题由论文的研究目标与背景合成,评判标准则从方法与实验部分推导,覆盖方法创新与实验设计两个维度。训练时 rubric 被使用两次:先作为 OPSD self-teacher 的特权上下文,再作为 GRPO 的奖励信号。
三个规模上的结果
在 Qwen3-1.7B / 4B / 8B 三个规模上,这一训练次序都优于监督微调、单独任意一个阶段以及反向顺序,五个基准的平均分分别提高 +5.6 / +5.0 / +4.8 分。固定配方不变,用 PaperGym-20k 语料训练的模型在三路对比中胜率 58.1%,对照组 RubricHub Science 为 28.2%。
全部开源
研究团队(Yuhan Wang 等 9 位作者)同时发布训练管线、2 万实例语料 PaperGym-20k,以及两个配套基准 PaperGym-Innov 与 PaperGym-Design,均可直接复用于研究规划模型的训练。
PaperGym 的核心贡献是把「问题来源」与「评判标准」从同一篇论文的不同部分分离,堵住了靠改写刷奖励的漏洞。对 AI 科学家方向的研究者,这套「论文即环境」的范式意味着:小模型配上高质量训练环境,也能在研究规划能力上超过大模型。