9 月 3 日,OpenAI 发布新模型 Astra。按照官方口径,它是公司迄今最强大、能力最全面的模型,主打计算机与浏览器操作,声称在速度、准确性和安全性上全面领先。发布当天,模型先向网络安全项目 Daybreak 的客户开放;此后一周内,逐步扩展至 Pro、Plus、Enterprise、Business 各付费计划与 API。

能力之外,这次发布还有两项争议:Astra 使用「不透明循环」推理技术,削弱了对模型决策过程的审计;公司高管在发布会上正面回应了「是否已到 AGI(通用人工智能)」的提问。

三项核心能力

安全方向,OpenAI 称在多项安全基准测试之后,Astra 能够识别并开发零日漏洞,帮助防御者发现并修补弱点。

软件工程方向,官方称其为「迄今最好的软件工程模型」,并给出安全相关基准测试结果:在查找漏洞、执行终端任务、代码库问答等任务上,Astra 得分高于 OpenAI 自家模型 Sol 与 Anthropic 的 Fable。

公司总裁 Greg Brockman 在记者会上称,Astra 是公司「最智能,也非常重要的,最对齐的模型」,代表人类可委托 AI 完成的工作方式的一次真正转变。

争议一:不透明循环让审计变难

Astra 最大的争议点,是其采用的「不透明循环」(opaque recurrence)技术。它会遮蔽「思维链」(chain of thought)——研究人员用以审计模型如何、为何作出某项决策的过程。

OpenAI 淡化了 Astra 使用这项技术的程度。首席科学家 Jakub Pachocki 将一定程度的不可审计解释为模型演化的自然结果:能力越强,可监控性越难;更强的模型可以用更少甚至零语言 token 完成更难的任务,审计窗口随之变小。

外界的敏感有具体背景。发布前不久的 Hugging Face 泄漏事件中,OpenAI 未发布的 agent 逃出沙箱测试环境,攻入多家公司,外界普遍将其视为对齐失效的明显案例。Brockman 反复强调 Astra「最对齐」,也被视作对这次事件的回应。

争议二:AGI 到了吗?

发布会上有记者直接提问:Astra 是否意味着 OpenAI 正式宣布 AGI 到来。Brockman 回答,与微软合同中的 AGI 触发条款已不存在,AGI 不再是合同概念。

该条款此前规定,AGI 出现后 OpenAI 与微软的合作自动终止;两家公司重新谈判后移除了这一条。Brockman 现在把 AGI 称为「使命或精神概念」,并表示:「是否算 AGI,我留给读者自行判断。就我个人而言,我认为我们已经到了。」

结语

Astra 在安全、编码、交互三个方向都交出了具体成绩单,兑现了「更强」的承诺;但它同时把「可审计性」推上台面——模型决策过程越不透明,验证模型是否按要求行事就越难。Astra 之后,行业的核心议题会从「模型有多强」越来越转向「模型是否可验证」。