当 AI 替你做判断时,它给出的「理由」很可能并不代表它真实的决策逻辑。一项 2026 年 9 月提交到 arXiv 的新研究用实验量化了这一点:大模型自报的关键影响因素,与其真实决策行为的相关度只有 0.35 至 0.58(满分 1);在相当多的情况下,模型根本没提到的因素,实际影响反而更大。
这项研究来自 7 位学者(第一作者 Urja Pawar 等),2026 年 9 月 4 日提交到 arXiv(全球最大的论文预印本平台,研究者把论文公开发布、供同行讨论的地方),编号 2609.05385。它研究的对象是大模型(LLM,用海量文本训练出来、能理解和生成文字的 AI 程序,ChatGPT 就是典型代表)在智能体(能自主完成多步任务的 AI 系统,会自己调用工具、做决定,而不只是聊天)工作流中给出的「解释」——也就是 AI 在给结论时附带的「我主要依据 X、Y、Z 做出这个决定」这类说明。
为什么解释的可靠性很重要
AI 智能体正在进入企业流程,替人做推荐、做审核、做判断。操作者依赖 AI 给出的理由做三件事:监控系统是否正常、排查出错原因、决定要不要把结果升级给人处理。
这一切的前提是:AI 说的理由和它真实的决策逻辑一致。如果 AI 嘴上说「因为 A」,实际行为却主要受 B 影响,那么建立在解释之上的监控和审计就会失灵。
实验怎么做:黑盒干预测真实影响
研究者让 8 个来自 Claude、GPT、Gemini 三个主流模型家族的大模型,在两个场景中做判断并自报 top 3 影响因素:
- 场景一:为客户推荐顾问;
- 场景二:判断提示词(用户输入给模型的文本)是否有害或有风险。
随后用黑盒干预(不打开模型内部,只改动输入、观察输出如何变化)实测每个因素的真实影响力,检验两种理解:
- 必要性:改变某个因素,输出跟着变,说明它确实起作用;
- 充分性:保留该因素、去掉其他可变信息,输出保持不变,说明它足以决定结果。
结果:自报排名与实测排名差距明显
把模型自报的因素排序,与黑盒实验测出的真实影响力排序对比(用 Spearman 相关系数衡量排名一致程度,1 为完全一致,0 为毫无关联):
- 顾问推荐场景:必要性相关度 0.349,充分性相关度 0.354;
- 提示词监控场景:必要性相关度 0.431,充分性相关度 0.580。
也就是说,最好的情况也只有中等水平。更直观的一组数据:模型点名之外的因素,得分反而高于模型点名的「最低分因素」——顾问推荐场景中这种情况占 57.6%(必要性)和 58.1%(充分性);提示词监控场景相对好些,但也有 25.8% 和 8.9% 的比例。
这意味着什么
论文的结论很清楚:模型点名引用的 top 3 因素包含有用信息,但无法可靠代表真实影响最强的因素。研究者同时提供了一套黑盒可靠性检查框架,可以在不打开模型内部的前提下验证「解释」与「行为」是否一致,对智能体监督(盯着 AI 干活是否跑偏)和 AI 审计有直接价值。
对普通用户来说,启示同样实际:AI 解释得头头是道,不代表它真的按这套逻辑思考。解释可以当参考线索,但涉及关键决策时,要用行为证据去验证,而不是把 AI 的自述当成事实陈述。在 AI 承担越来越多重要工作的当下,验证 AI「说的」与「做的」是否一致,正在成为一项必修课。