1. QuestBench:评估大语言模型在推理任务中的信息获取能力
在2025年NIPS会议上发布的QuestBench研究,揭示了大语言模型(LLMs)在推理任务中一个被长期忽视的关键能力缺陷:主动获取缺失信息的能力。传统评估大多假设任务定义完整,而现实场景中,问题往往存在信息缺口。这项研究通过精心设计的基准测试,首次系统性地测量了模型"提出正确问题"的能力。
研究团队将信息获取问题形式化为带有缺失变量赋值的约束满足问题(CSP)。通过限定仅缺失一个必要变量赋值,他们能够精确评估模型识别最小必要问题的能力。这种设计既控制了问题复杂度,又保留了现实场景的核心挑战。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. QuestBench的四大任务构成与设计原理
2.1 Logic-Q:逻辑推理中的命题缺失
在命题逻辑问题中故意省略一个关键命题,要求模型识别需要澄清的逻辑要素。例如给定"如果A则B,如果B则C,那么?"的问题,模型需要意识到缺少"A是否为真"的信息才能完成推理。
2.2 Planning-Q:规划任务中的状态观测不全
基于PDDL的规划问题中,初始状态被部分隐藏。比如"将货物从A运到B"的任务中,模型需要询问"运输工具是否可用"这类关键状态信息。这类任务测试模型对规划前提条件的理解深度。
2.3 GSM-Q:小学数学应用题变量缺失
人工标注的小学数学文字题中刻意省略一个必要数值。例如"小明买了若干苹果,每个3元,共花费?"需要模型发现"购买数量"这个缺失变量。这类任务评估模型对现实问题的结构化能力。
2.4 GSME-Q:方程形式数学题变量缺失
GSM-Q的方程版本,将文字题转化为代数表达式但隐藏一个变量。如"3×?=12"测试模型对数学关系本质的把握,剥离语言理解的影响。
3. 当前LLMs在QuestBench上的表现分析
测试结果显示,模型在不同任务类型上表现差异显著:
- GSM-Q/GSME-Q:>80%准确率
- Logic-Q/Planning-Q:40-50%准确率
这种差距揭示了两个重要发现:
- 模型在结构化数学问题上表现良好,因其训练数据中包含大量类似模式
- 在需要深度逻辑分析和状态推理的任务上表现欠佳,说明当前模型更擅长模式匹配而非真正的推理
特别值得注意的是,模型在完整信息版本的任务上能达到高准确率,但在需要主动提问的版本中表现大幅下降。这表明解决明确定义的问题与识别信息需求是两种不同的能力维度。
4. 信息获取能力的核心挑战与技术启示
4.1 信息必要性判断的困难
模型难以区分必要信息与冗余信息。在Planning-Q中,模型常会提出不影响解决方案的问题,显示出对任务本质理解的不足。
4.2 问题表述的精确性要求
即使识别出需要什么信息,如何准确表述问题也是挑战。Logic-Q中,模型可能知道需要某个命题的真值,但提问方式可能模糊或包含逻辑错误。
4.3 与人类认知的差异
人类会基于常识和经验快速定位信息缺口,而模型缺乏这种直觉。GSM-Q中人类会自然关注数量关系,而模型可能过度依赖表面语言模式。
5. 提升LLMs信息获取能力的可行路径
5.1 针对性训练策略
- 增量式信息揭示训练:逐步提供信息,让模型学习信息价值评估
- 对比学习:展示完整与缺失信息的问题对,强化缺口识别
- 问题生成微调:专门训练提问能力而非仅回答问题
5.2 架构改进方向
- 显式信息需求模块:分离信息评估与问题解决流程
- 记忆增强机制:维护信息状态跟踪,明确标记未知项
- 不确定性量化:为每个推理步骤附加置信度评估
5.3 评估体系扩展
- 引入动态对话评估:模拟真实信息获取交互过程
- 开发多轮提问基准:测试连续信息需求识别能力
- 增加领域多样性:涵盖科学、法律等专业领域的信息获取
6. QuestBench对AI发展的长远意义
这项研究突破了传统静态评估的局限,将AI评估推向更贴近真实人机交互的动态场景。它揭示的不仅是模型的能力边界,更是智能的本质特征——真正的理解必然包含知道"自己不知道什么"的元认知能力。
在实际应用层面,这项研究为开发更可靠的AI助手指明了方向。无论是客服系统、教育辅导还是决策支持,能够主动澄清模糊之处的AI才真正具有实用价值。未来,我们或许会看到"提问能力"成为评估AI系统的核心指标之一。
我在实际研究中最深的体会是:当前模型在信息完备的封闭环境中表现优异,但面对现实世界的不确定性时仍显笨拙。QuestBench的价值就在于它迫使我们去思考——真正的智能不应只是回答问题的高手,更应该是提出关键问题的大师。这其中的差距,或许正是通向更通用人工智能的关键路径。
