一个 90 亿参数(9B)的开源 AI 模型,经过一套「用真实执行结果验证过的数据」微调后,在多项测试中追平了同家族 270 亿参数(27B)、未经微调的大模型。这套方法来自一篇 2026 年 9 月 4 日提交到 arXiv 预印本平台的论文(编号 2609.05395),已被自然语言处理领域顶级学术会议 EMNLP 2026 的行业轨道接收。论文还同时发布了一个新基准 KOPA-Bench——用韩国政府开放接口(API)的 145 个真实任务来考核模型的多步工具调用能力。
先交代几个关键词。大模型(LLM)是用海量文本训练出来、能理解并生成文字的 AI 程序,ChatGPT 就是典型代表。开源模型指权重公开、任何人都能下载和本地部署的模型,与之相对的是只能通过网络接口调用、内部不可见的闭源模型。模型的参数数量以 B 为单位(1B 等于 10 亿),大致决定模型的容量,通常参数越多、能力越强。工具调用(tool calling)指让 AI 在对话之外调用外部软件完成操作的能力,API(应用程序接口)就是软件之间互相通信的标准化通道;多步工具调用则是为完成一个任务连续调用多个工具,比如先查企业工商信息、再查相关新闻、最后汇总成一份报告。
一个被忽略的缺口:开源模型不会多步调用工具
越来越多的国家和地区实施数据主权法规:公共部门的数据必须在本国境内存储和处理,机构必须把模型部署在自己的服务器上,而这类本地部署通常只能选用开源模型。这些机构期待的是 AI 智能体(能自主执行任务的 AI 程序)跨多个政府 API 连续调用工具、自动把事办完。
但论文指出一个现实缺口:开源模型在这种多步调用场景下持续表现不佳,而此前没有任何公开基准能量化这个差距——大家只知道它不行,不知道差多少、差在哪里。
KOPA-Bench:145 个真实任务当考卷
五位研究者(Dain Kim、Eungi Cho、Kyumin Kim、Shinyeong Noh、Kyuseong Lim)构建了韩国开放公共 API 基准 KOPA-Bench:从韩国政府真实对外开放的接口中整理出 145 个真实任务,覆盖查数据、填信息、跨系统办事等实际场景。每个任务都要求模型连续调用多个工具、消化中间结果才能完成,贴近真实业务,而不是实验室里的玩具题。
EDGE:只用「真实执行成功」的路径合成训练数据
光有考卷不够,论文还给出提升开源模型能力的配方:EDGE(Execution-grounded Dynamic Graph,执行接地动态图)数据合成方法。
训练 AI 需要大量「问题—正确操作步骤」配对数据。过去合成这类数据,常靠大模型凭空生成:步骤看起来合理,真实执行却会出错,模型学到的其实是错误示范。EDGE 反过来做:先构建一张图,记录每个工具的输出可以怎样作为下一个工具的输入;然后让这些调用链条真正跑一遍线上 API,只保留真实执行成功的连接;最后沿着这些验证过的路径,合成可直接执行的完整任务轨迹作为训练数据。核心思路一句话:所有训练数据都先经过真实世界的检验。
实验结果:9B 追平 27B
研究者用 GRPO(一种强化学习训练方法,让模型通过试错和奖励信号不断优化行为)在这套数据上微调了一个 90 亿参数的开源模型。结果显示:微调后的 9B 模型在 KOPA-Bench 上几乎追平同家族 270 亿参数、未做微调的模型;在 BFCL(伯克利函数调用排行榜,国际通用的工具调用能力基准)上也有大幅进步。
也就是说,一个参数规模只有对方三分之一的模型,靠数据配方的改进,在特定领域追平了三倍大小的模型。对必须本地部署、算力和电力都有限的机构来说,这直接意味着更低的服务器成本和功耗。
为什么值得关注
这则研究踩中三个正在发生的趋势:数据主权法规推动公共机构转向开源本地化部署;合成数据正成为训练数据的主要来源,而如何保证合成数据的正确性是行业共同难题;小模型通过优质数据逼近大模型能力正在成为现实。EDGE 给出的答案——用真实执行结果验证合成数据——简单直接,而且可以推广到 API 之外的更多场景。
机构最终选用 9B 还是 27B 模型,需要结合自己的数据、算力和任务量权衡。但这篇论文传递了一个明确信号:在细分场景里,数据配方的价值可能比模型体积更重要。