2026 年 9 月 1 日,OpenAI 宣布新一代模型 Astra 将采用一种名为「不透明循环」(opaque recurrence,也称 recurrent depth)的推理技术。这项技术让模型可以在顺序思维链之外运行,对同一查询循环处理多次,留下更少可读痕迹。消息公布后,多位 AI 安全领域的研究者公开表示担忧:如果该技术被大规模推广,行业对模型行为的监控能力可能明显下降。
什么是「不透明循环」推理
主流推理模型的思维链(chain of thought)会输出模型逐步解决问题的过程。这种记录并不完美,但仍是监控模型行为、排查异常的重要工具——在 OpenAI 此前的越权代理(rogue agent)事件中,思维链记录就是还原代理行为的关键线索。
「不透明循环」走的是另一条路径:模型对同一查询循环处理多次,推理过程不再呈线性展开,最终留下的可读痕迹明显更少,相当于绕开了传统思维链记录。所有 AI 模型本来都存在一定数量的不透明推理,研究者也很少把思维链日志当作模型推理的完整呈现;这次的不同在于,OpenAI 将「循环」作为一种主动采用的技术引入,且使用规模可以扩展。
安全界的担忧
Redwood Research 首席执行官 Buck Shlegeris 在 X 上表示非常担忧:如果 OpenAI 进一步推广这项技术,就有能力大幅增加循环次数,彻底摧毁思维链的可监控性。
长期关注 AI 安全的 Zvi Mowshowitz 认为,该技术是在「玩火」,触及 OpenAI 与 Anthropic 一直努力维护的底线——思维链的真实性与可监控性。他提出,更密集地使用这类技术会损害可监控性,甚至可能需要立法,防止各家 AI 实验室陷入「竞次」(race to the bottom)。
Redwood Research 首席科学家 Ryan Greenblatt 则担心技术演进的自然结果:不透明推理的扩展速度可能超过传统思维链推理,最终让模型几乎完全在「潜在空间」(latent space)中推理,即在人类不可见的内部表示里完成全部思考。他呼吁 OpenAI 就此止步。
OpenAI 的回应
OpenAI 首席科学家 Jakub Pachocki 回应称,OpenAI 自首个推理模型起就致力于保留并利用思维链监控,这是当前研究计划的核心目标之一。
据 TechCrunch 报道,Astra 对「不透明循环」的使用目前有限,模型的思维链仍预期可读;OpenAI 也否认会转向完全不可读的「神经语」(neuralese)。另据 The Information 的后续报道,Anthropic 与 Google DeepMind 已经开始讨论这项技术。
结论
「不透明循环」推理短期内对模型可监控性的影响有限——Astra 的使用范围小,思维链仍然可读。但安全专家真正担心的不是 Astra 本身,而是方向:推理可以离开可监控的通道,一旦这类技术被规模化,行业共同维护的「思维链可监控」底线就会被削弱。接下来值得跟踪的是 OpenAI 是否会扩大该技术的使用范围,以及 Anthropic、Google DeepMind 的跟进动作。