1. 论文背景与核心问题解析
1.1 大型语言模型的幻觉困境
在自然语言处理领域,大型语言模型(LLM)如GPT-4展现出了惊人的文本理解和生成能力。但当我们深入使用这些模型处理需要精确事实知识的任务时,会发现一个根本性问题——模型会自信地生成看似合理实则错误的回答,这种现象被称为"幻觉"(Hallucination)。就像一位知识渊博但记忆力不可靠的学者,LLM可能将不同来源的信息混淆,或者基于统计规律而非事实依据进行推断。
我在实际项目中使用GPT-4进行医疗问答测试时,就遇到过模型将两种相似病症的治疗方案混淆的情况。这种幻觉在开放域对话中可能不易察觉,但在需要精确答案的专业领域(如法律咨询、医疗诊断)就会造成严重问题。
1.2 知识图谱的互补价值
知识图谱(KG)作为结构化的知识库,恰好能弥补LLM的这一缺陷。它以三元组形式存储事实(如<阿司匹林,治疗用途,止痛>),具有精确性和可验证性。我在构建金融知识图谱时,这种结构化表示使得我们可以精确追踪每个事实的来源和时效性。
但KG也有其局限性——它缺乏LLM的语义理解和泛化能力。当用户用自然语言提问"什么药能缓解头痛"时,纯KG系统需要精确匹配"治疗用途"这样的关系,而LLM则能理解这是与"止痛"相关的查询。
1.3 现有融合方法的缺陷
当前主流的LLM+KG融合方法(如ToG)采用迭代检索-推理范式,但存在两个关键问题:
长路径干扰问题:就像让一个人记住并处理20个连续推理步骤,中间任何一步的注意力分散都会导致最终错误。我在复现ToG时发现,当推理链超过4跳时,模型正确率会下降40%以上。
语义误导问题:基于相似度的关系选择容易陷入局部最优。例如在测试"获得诺贝尔文学奖的亚洲作家"时,模型会因"获奖"关系的重复出现而陷入循环推理,无法正确追踪到"国籍"这一关键关系。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. DoG框架设计原理
2.1 整体架构设计
DoG(Debate on Graph)采用了一种渐进式验证的推理策略,其核心思想可以类比于科学研究的"假设-验证"方法:
- 单步验证:每次只处理一个三元组,就像科学家一次只做一个实验
- 即时反馈:立即评估该证据是否足够回答问题,避免无效积累
- 问题重构:当证据不足时,通过辩论机
