1. 研究背景与核心发现
这项由东北大学Khoury计算机科学学院与ServiceNow研究院、Mila实验室合作的研究,为我们揭示了大型语言模型(LLM)决策过程中一个令人深思的现象:模型往往在开始"思考"之前就已经做出了决定,后续的推理过程更像是为预设结论寻找合理化的解释。
研究团队选择了工具调用决策作为实验场景,因为这种决策具有明确的二元性质——要么调用工具,要么不调用。通过设计精巧的实验,他们发现可以在模型开始任何可见的"思考"过程之前,就以超过95%的准确率预测出模型最终会做出什么决定。这个发现挑战了我们对AI推理过程的传统认知。
提示:这种现象在认知科学中被称为"后验合理化",人类也经常会在潜意识中做出决定后,再通过理性分析为这个决定寻找理由。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 研究方法与技术细节
2.1 实验设计与模型选择
研究团队采用了两个最新的开源推理模型作为主要研究对象:
- Qwen3-4B:40亿参数的中文大模型
- GLM-Z1-9B:90亿参数的多语言模型
同时,在附录中提供了GPT-OSS-20B的补充结果,确保了研究结论的普适性。
2.2 关键技术方法
研究采用了三种核心技术来"窥探"模型的内心活动:
-
前向钩子技术:
- 在模型的神经网络中设置多个监听点
- 捕获模型处理每个token时的内部表征
- 重点关注几个关键时刻:推理开始前、开始时、过程中多个百分位点,以及结束时
-
线性探针技术:
- 使用简单的逻辑回归分类器
- 从模型的内部状态预测最终决策
- 采用5折交叉验证确保结果可靠性
-
激活引导技术:
- 计算倾向调用工具和不调用工具的样本群体在特定神经网络层的平均激活差异
- 形成引导向量,以不同强度影响模型的决策倾向
- 使用100个独立测试样本进行评估
3. 关键发现与数据分析
3.1 决策时间点的惊人发现
研究数据显示,模型的决定在推理开始前就已经形成:
| 预测时间点 | 准确率(%) | 一致性(%) |
|---|---|---|
| 推理开始前 | 95.2 | 82.3 |
| 推理10%时 | 88.7 |
