AI 智能体正在学习像人一样操作电脑:打开软件、点击按钮、填写表单、完成一整条任务。这类程序叫作「计算机使用智能体」(能自主操作电脑完成任务的 AI 程序),是 AI 落地的重要方向之一。但长期以来,它们大多只会一种操作方式——像人一样用鼠标在图形界面里点击,步骤多、速度慢;而真实世界的工作,其实是「图形界面」和「命令行」两种方式的混合。
2026 年 9 月 4 日提交到 arXiv(全球最大的学术预印本平台,研究者公开发布论文草稿的地方)的一篇论文,提出了一个名为 CUA-Universe 的系统来破解这个问题:它把真实桌面软件成批改造成「图形界面 + 命令行」混合的训练环境,再用产出的数据训练出一个 9B(90 亿参数)规模的小模型。结果是,这个模型在行业常用的 OSWorld 基准(考核 AI 操作电脑能力的标准测试集)上,任务成功率提升 16.8 个百分点,完成步骤减少 57%。
计算机使用智能体卡在哪
计算机使用智能体为什么值得关注?因为它们能替人完成重复的电脑操作:批量处理文件、操作业务系统、执行跨软件的数据搬运。业界已有 OSWorld、AndroidWorld 等基准测试(行业公认的标准化考试)来衡量它们的水平,模型的得分持续上升。
但进步集中在一条路上:只看图形界面。图形界面(GUI)就是普通用户看到的那种「鼠标点击」的界面;命令行(CLI)则是通过输入文字指令来操作电脑的界面,例如在终端里敲一条命令批量重命名几百个文件,几秒钟完成。
两种方式各有短板:
- 只会图形界面的智能体:把操作拆成大量细碎点击,动辄几十步,效率低。
- 只会命令行的智能体:没有视觉感知,遇到「看看这个界面长什么样」「检查这个页面布局」这类任务就无从下手。
真实的电脑工作两者都要用:先看一眼界面确认状态,再用命令高效执行。问题在于,同时支持两种方式的训练环境非常稀缺——让智能体在真实软件上同时操作 GUI 和 CLI,每个应用都需要大量人工搭建,成本太高。
CUA-Universe 的三步流水线
CUA-Universe 是一个「环境到数据」的流水线(把真实软件变成训练环境、再把环境产出变成训练数据的整套流程),由三个组件构成:
App-Forge(应用锻造):把真实桌面软件适配成可复现的虚拟机——虚拟机(VM)就是用软件模拟出来的整台电脑,可以随时重置回初始状态,适合反复训练。App-Forge 会自动发现、包装或生成每个应用的命令行操作入口,目前已扩展到 16 个应用。
Task-Weave(任务编织):从种子文件里的可复用操作出发,合成难度可控、形式多样的混合任务——既有界面操作,也有命令操作,还有两者的组合。
Path-Steer(路径引导):引导模型沿高效的混合操作路径完成任务,并把验证过的轨迹(模型完成任务的操作过程记录)收集起来,用于后训练——在模型已有能力的基础上,用专门的数据进一步训练,让行为向「界面 + 命令协同」转变。
训练效果:小模型也能又快又准
论文用这套流水线产出的数据训练了一个 9B 参数的小模型,在三个测试集上做了验证:
- CUA-Verse(论文自带的基准):得分提升 39.3 分,步骤减少 37%,token 消耗减少 60%。token 是模型处理文本的计量单位,可以粗浅理解为「算力花销」,token 减少意味着更省钱、更快。
- OSWorld:任务成功率提升 16.8 个百分点,步骤减少 57%,token 消耗减少 44%。
- OSWorld-MCP:得分提升 7.84 分,步骤减少 27%,token 消耗减少 30%。
三个测试集上都同时出现「成功率/得分上升 + 步骤和 token 下降」,说明模型不是靠多折腾换成绩,而是真的学会了用更聪明的混合方式干活。
这篇研究带来的信号
把这条消息放进行业背景里看,有两层含义。
第一层,训练数据的范式正在转变:过去教智能体操作电脑,默认路径是「模拟人点鼠标」;CUA-Universe 证明,「图形界面看状态、命令行做执行」的混合路径,能让智能体用更少步骤完成同样任务,这是一条可扩展的数据生产路径——应用越接越多,数据越滚越多。
第二层,模型规模不是唯一答案:这个 9B 小模型靠高质量训练数据,在多个基准上同时提升成功率与效率,说明对「操作电脑」这类任务,数据质量对结果的影响不亚于模型大小。
一句话带走:想让 AI 高效操作电脑,关键不只是把模型做大,而是让它学会像人一样,在图形界面和命令行之间灵活切换。