1. RouteRAG:重新定义RAG的检索决策逻辑
在传统检索增强生成(RAG)系统中,检索动作通常由固定规则或简单启发式方法触发。这种设计存在明显局限:要么过度检索导致效率低下,要么检索不足影响回答质量。RouteRAG的创新之处在于,它将整个检索决策过程转化为可学习的策略,让模型自主决定何时检索、检索什么内容以及采用哪种检索模式。
这个思路源自对现有RAG系统的痛点观察。当前主流方案通常采用两种极端策略:一种是"检索所有可能相关内容"的暴力方法,另一种是"仅当模型不确定时才检索"的保守策略。前者会产生大量无关检索,后者则容易因自信幻觉导致错误。RouteRAG通过引入特殊Token(
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心架构与工作流程
2.1 基于Token的动作决策机制
RouteRAG的核心是一个策略模型πθ,它在生成每个Token时都需要做出三类关键决策:
- 继续推理:当模型认为现有上下文足够支持下一步生成时
- 发起检索:通过输出
... 标签触发 - 终止回答:通过
... 标签结束流程
检索动作的细节通过标签属性指定:
xml复制<search mode="[graph][passage]">子查询文本</search>
这种设计巧妙地将控制流与数据流统一在同一个生成过程中,无需额外的规则引擎。
2.2 多模态检索系统
RouteRAG支持三种检索模式,每种都有其独特的优势场景:
| 检索模式 | 适用场景 | 技术实现 | 响应时间 |
|---|---|---|---|
| 段落检索 | 事实型查询 | DPR稠密检索 | 快(~50ms) |
| 图谱检索 | 关系型查询 | HippoRAG2+PageRank | 慢(~300ms) |
| 混合模式 | 复杂查询 | RRF排名融合 | 中等(~150ms) |
实际测试表明,对于简单事实查询(如"北京人口"),段落检索的准确率与混合模式相当,但速度快3-5倍。而对于多跳问题(如"特朗普的第一任妻子的第二任丈夫的职业"),图谱检索能
