OpenAI 的 GPT-6 Astra 大模型在 ARC-AGI-3 基准测试中取得当前最高成绩:在保留推理状态的评测条件下得分 99.9%,在标准评测条件下得分 62.7%。更受关注的是行动效率——它在 96% 的关卡上完成任务所需操作次数低于人类测试者的中位数,平均每关少用 51.7% 的操作。发布这项结果的 ARC Prize 判断,这是前沿模型能力的一次「阶跃式变化」,但同时明确:通过这项测试不代表实现通用人工智能。

先交代两个主角。

OpenAI 与 GPT-6 Astra。 OpenAI 是美国一家人工智能公司,因开发聊天机器人 ChatGPT 广为人知,是目前全球大模型领域最主要的推动者之一。GPT-6 Astra 是 OpenAI 的 GPT-6 系列大模型(大模型:用海量文本和代码训练出来、能理解并生成文字与程序的 AI 程序)之一。它在本次评测中展现出连续处理多步任务的能力:自己保存笔记、拆分步骤、调用工具,像一个能在数字环境里独立干活的员工。

ARC Prize 与 ARC-AGI-3。 ARC Prize 是由 AI 研究者 François Chollet 等人创办的非营利机构,长期设计标准化考题来衡量 AI 能力,这类考题叫基准测试(benchmark)。ARC-AGI-3 是它发布的第三版基准,与常见考试不同:它把 AI 放进一系列陌生的回合制小游戏环境,人类可以 100% 通关,但规则和目标都不直接告诉 AI,AI 必须自己摸索环境、推断规则、规划动作并执行。评测把这种能力拆成四块:探索(主动获取信息)、建模(把观察变成可预测的模型)、目标设定(在稀疏奖励下识别目标)、规划与执行(走通到达目标的路径并及时修正)。这四块合起来叫智能体能力,即让 AI 不只回答问题、还能在环境里真正干活的能力。

两套评测条件,两档成绩。 ARC Prize 用两种评测支架(harness,模型接入测试环境的技术方式)分别测试 GPT-6 Astra:

  • 标准支架(Standard harness):所有厂商通用的最小化接口,模型只能自己决定保留哪些笔记。GPT-6 Astra 最高档得分 62.7%,整场评测成本约 2.6 万美元。
  • 厂商适配支架(Provider Adapter harness):允许使用 OpenAI 自家的上下文管理能力,在请求之间保留推理状态并压缩长对话。GPT-6 Astra 得分 99.9%,成本约 1.88 万美元。

两种条件下的成绩都是 ARC-AGI-3 当前最优。在两个支架都完成的 167 组游戏-推理对上,厂商适配支架合计用时约为标准支架的三分之一(快 3.66 倍),总 token 消耗少 49%。token(令牌)是大模型读写文本的基本单位,消耗越少,运行成本越低。

行动效率首次超过人类基线。 ARC Prize 发布前招募约 500 名普通公众做对照,用完成各关卡的玩家动作数中位数作为人类基线。GPT-6 Astra(max 档)在 96.0% 的关卡上动作数少于人类中位数,平均每关少 51.7%。ARC Prize 原本猜测行动效率会长期是人与 AI 的分界线——AI 即使通关也可能比人试错更多;实测显示,前沿模型一旦理解机制,执行效率能进入人类区间。人类测试者的成本是每 90 分钟 115 美元、每完成一关加 5 美元,平均每关约 12.78 美元。

两个值得注意的行为。 评测回放里,GPT-6 Astra 有两个特点:一是自创符号笔记,把游戏场景压缩成自己发明的代数简写来记录状态与计划,例如用「L8: hub q2 (8↓)」记录关卡参数、用「extend8 to3; retract10 to2; shorten8 to1」记录动作序列,把陌生环境转成类似代码的符号模型;二是在评测环境 PRO-LONG 中,它能使用沙箱(可运行代码的隔离环境)为每关自动生成专用工具,比如在迷宫关卡依次写出 maze_solver.py、combat_solver.py、patrol_solver.py 等脚本。这说明它能按任务临时构建自己的软件工具。

结论:进步明显,不等于 AGI。 ARC Prize 的判断分两层:一方面,GPT-6 Astra 在陌生环境中学习与执行的效率是评测推出以来最明显的单次跃升,代表前沿模型能力的阶跃式变化;另一方面,ARC-AGI-3 的环境范围有界、机制确定且封闭,不等于现实世界的复杂与开放,通过这项测试不构成实现 AGI(通用人工智能,能像人一样学习并完成各种智力任务)的证据。

对读者来说,这条消息的实际含义是:大模型正在从答题工具走向能在陌生环境里自己探索、自己建工具干活的智能体,GPT-6 Astra 在这条赛道上目前领先;同时,衡量智能体能力的测试本身仍在快速演进,后续各家模型的 ARC-AGI-3 成绩会持续更新榜单。