1. 项目概述
在协作式对话系统中,澄清提问一直是个棘手的问题。传统方法要么过于被动(从不提问导致错误累积),要么过于依赖对人类行为的模仿(但人类提问策略本身存在高度不一致性)。纽约大学团队发表在EACL 2024的这项研究,通过CoDraw协作绘图任务揭示了一个关键发现:模型内部的不确定性度量与人类实际提问行为的相关性出人意料地低(逻辑回归平均精度仅0.188)。这直接挑战了当前主流"用人类提问数据训练模型"的研究范式。
基于此,研究者提出了QDrawer框架——通过显式计算模型在剪贴画尺寸预测上的分布熵,当不确定性超过阈值时,用模板化提问主动补齐缺失信息。这种看似简单的设计,在实验中却使尺寸预测准确率提升23.1%,整体任务相似度提高7.8%。更重要的是,相比需要复杂语言生成的端到端方案,这种基于确定规则的提问机制更易于分析和控制,为工业级应用提供了可靠路径。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心问题解析
2.1 澄清提问的两难困境
在真实人机对话场景中,系统面临根本性矛盾:
- 过度提问:像新手客服那样事无巨细地确认每个细节("您说的是红色吗?大小是中号吗?"),虽然能避免错误但会严重损害用户体验
- 从不提问:如某些"听话"的语音助手,即使指令模糊也强行执行(把"定个会议室"误解为"订会议室"),导致错误雪球式累积
现有解决方案主要分三类:
-
基于规则:预设关键词触发(如检测到颜色/尺寸缺失时提问)
- 优点:确定性高,易调试
- 缺点:覆盖率低(无法处理"把沙发往那边挪点"这类模糊指令)
-
数据驱动:用人类提问记录训练分类器
- 痛点:人类策略差异大(有人遇疑必问,有人倾向推测),导致标签噪声严重
- 实验显示,即使相同模糊指令,人类提问概率差异可达60%
-
模型自决策:依赖LLM内部置信度
- 实践难点:模型往往过度自信,softmax概率不能真实反映不确定性
2.2 CoDraw任务的代表性
选择协作绘图(CoDraw)作为测试平台具有三重优势:
- 可控复杂性:剪贴画属性(尺寸/位置/朝向)明确可量化,便于设计不确定性度量
- 部分可观测:Drawer无法看到Teller的参考图,与现实场景中信息不对称一致
- **细粒度标注
