9 月 4 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra 与 GPT-6 Astra Pro。这次发布的核心变化,是把模型从“回答问题”推向“直接完成工作”:Astra 可以操作电脑与浏览器、进入不同软件执行多步骤任务,并交付可直接使用的文档、表格、演示文稿甚至工程项目。OpenAI 总裁 Greg Brockman 在发布会结尾宣布“欢迎来到 AGI 时代”。
规模与定价:史上最大训练任务,价格翻倍
Astra 是 OpenAI 历史上规模最大的训练任务,在得克萨斯州 Stargate 园区动用超过 10 万块 GPU 完成预训练,也是首款由前代模型深度参与训练监督的旗舰产品。
API 定价同步公布:输入 10 美元/百万 token,输出 50 美元/百万 token,是上一代 GPT-5.6 Sol(输入 4 美元、输出 20 美元)的 2.5 倍,与 Anthropic 的 Fable 5.1 持平。OpenAI 给出的解释是,比每百万 token 单价更有意义的指标是“完成一项任务需要多少钱”:Astra 在 OSWorld 2.0 离线测试中单任务平均耗时约 40 分钟,而 Sol 需要约 75 分钟,耗时减少约 47%。返工更少意味着完成整项工作的总成本可能更低。
基准成绩:多项接近满分
在多项基准测试中,Astra 的成绩明显高于上一代:
- FrontierMath Tier 4 v2(高难数学):97.6%
- ARC-AGI-3(陌生环境推理):99.9%,上一代 Sol 为 7.8%;OpenAI 说明该成绩经由 Responses API Harness 运行,包含记忆管理与 Agent 运行框架的增益,并非纯基础模型成绩
- ExploitBench(漏洞利用):100%
- Terminal-Bench 4.0(编程):57.7%,高于 Fable 5.1 的 55.8% 与 Sol 的 37.3%
- GPQA Diamond(研究生级科学问答):96%,略高于 Gemini 3.8 Flash 的 95.3%
- AutomationBench(真实办公流程):41.4%,上一代 Sol 为 18.1%
网络安全:更会找漏洞,也更守边界
Astra 在 ExploitGym 上从 Sol 的 30.3% 提高到 42.4%;面对近三个月公开的新漏洞,成功率为 39%,Sol 只有 5.5%。测试期间它还发现并利用了 2 个此前未知的 V8 零日漏洞。边界感同样有量化结果:在一项模拟网络安全任务中,OpenAI 故意留下可被利用的诱饵漏洞,Sol 有 48.2% 的测试出现越界行为,Astra 为 0%。
真实场景:从办公文件到游戏开发
第一批企业测试已经给出可量化的结果。法律 AI 平台 Legora 用 Astra 一次核对 41 份财务文件,几分钟内找出全部 4 个预埋错误,其中包括收入附注中一处 50 万英镑的差额,单看这项任务比上一代快近 40%。游戏公司 Playco 让 Astra 直接进入 Unity 和 Godot,同一份灰盒底稿一次产出 3 个不同主题的可玩原型,人工修补工作量减少一半。
开放范围与判断
按官方计划,Astra 面向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,Astra Pro 面向 Pro、Business 和 Enterprise 用户,免费用户暂不可用。
GPT-6 Astra 的意义不在于把单项基准分数推到接近满分,而在于它开始把“完成整段工作”当作模型的主业:持续读取信息、调用工具、检查结果,再根据反馈修改产出。当完成一项任务的总成本成为新的比较维度,模型竞争中真正被比较的,将是谁能用更少的步骤、更少的费用把事情做完。