Meta AI 与伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究者发布了一套名为 EvoHarness-RL 的 Agent 训练框架:以 Qwen3-8B 为基座模型,在 ALFWorld 基准上拿到 96.9% 的平均成功率,追平 Claude Opus 4.5 开箱即用的 96.4%。论文编号 arXiv:2608.05446,共同作者 Xuying Ning 接受了 VentureBeat 采访。这套方法没有换更大的模型,而是把「Agent 什么时候该用工具、如何管理自己的状态」从人工写死的规则,变成模型自己学会的行为。
长程 Agent 的瓶颈在外围装置(harness)
Agent 执行跨数小时的企业级任务(例如把海量客户记录从旧 CRM 迁移到云数据库)时,上下文窗口不够用,必须依赖运行时外围装置(harness):它提供服务器日志这类执行反馈,用状态追踪器与控制流机制管理已完成和待办的子目标,出错时给出恢复工具。传统做法是工程师手写一套规则和提示词,告诉 Agent 何时用工具。问题在于最优 harness 常常随模型变化——模型一升级,提示词、记忆结构、权限、沙箱配置都要重新调试,这是持续消耗工程资源的环节。
论文共同作者 Xuying Ning 还指出,只会累积经验的记忆系统会拖累推理:append-only 记忆把过时结论、失败尝试一并保留,长任务里这些噪声反而干扰判断。长程 Agent 需要的是能更新、压缩、替换的动态记忆。
BPE:外部状态分成三个功能区
EvoHarness-RL 把 Agent 的外部状态整合为一个统一界面,分三个功能区:Belief(对当前环境的准确认知)、Progress(已完成与待办子目标)、Experience(跨任务可复用的历史经验)。Agent 不再调用一堆领域专用 API,而是用四个元操作交互:track(追踪实时环境)、commit(提交工作流更新)、recall(行动前调取过往策略)、note(把新发现写成笔记供后续使用)。
两阶段训练:监督微调加成本感知强化学习
第一阶段是监督式 harness 微调,让基座模型学会从混乱的交互日志中提取事实、整理进 BPE 结构;第二阶段是成本感知的强化学习,训练模型判断「查一次外部状态值不值这些 token 开销」,而不是每步都盲目查询。工具使用由此从硬编码提示词变成学出来的运行时行为。
实测:8B 追平前沿,冻结模型同样受益
在 ALFWorld 文本环境基准上,EvoHarness-RL 训练的 Qwen3-8B 平均成功率 96.9%,比 ReAct 基线高 49.0 个百分点;对比其他可训练框架,SkillRL 为 89.9%、SkillOS 为 80.2%;对比闭源前沿模型,Claude Opus 4.5 开箱为 96.4%。BPE 的收益不止于小模型:把 BPE 以提示词形式套给冻结的现成前沿模型后,GPT-4.1 成功率提升 22.1 个百分点,GPT-5 提升 25.7 个百分点。
训练过程中还能观察到模型行为的变化。训练后期,模型对熟练的常规动作减少了工具查询、把成功模式直接内化进参数,研究者称之为 harness 退火(annealing)——对企业意味着更低的延迟与推理成本;而遇到陌生环境或意外障碍时,模型会主动加大 Belief 与 Experience 的使用,例如迁移数据库时碰上陌生的遗留 API,它会放慢速度、拉取实时日志与历史工单,而不是凭空猜测。
落地:不必替换现有工具栈
框架带环境适配器,内部实现可以继续与组织现有工具保持领域绑定,共享的只有可训练的那一层。Ning 表示,BPE 可以作为一层额外的状态管理层接入现有编排系统,团队不必替换当前工具或 Agent 框架。他建议预算敏感的企业采用混合异步架构:用前沿模型生成高质量的整理数据,再微调开权重模型处理日常状态管理;整理可以异步进行,不拖慢主执行循环。他也提醒不要过度设计——短而稳定的任务,ReAct 或标准 RAG 已经够用,BPE 的价值在持续数小时、数天甚至数周的长程任务上才明显。
结论
EvoHarness-RL 传递的信号是:Agent 能力的下一轮提升未必来自更大的模型,而可能来自把「如何管理自身状态、何时使用工具」变成可训练的行为。对预算敏感的团队,这提供了一条以 8B 级模型逼近前沿模型表现的现实路径;代价是把 harness 从一次性配置,变成需要持续训练与调优的投入。