1. 论文核心思想解析
这篇论文提出了LLM-R框架,旨在解决大语言模型(LLM)在上下文学习(ICL)中对示例选择高度敏感的问题。传统检索方法如BM25主要关注表面语义相似度,而忽略了LLM实际需要的"逻辑启发性"示例。作者创新性地利用LLM自身的反馈信号(log-likelihood)来训练专门的检索器,实现了从"通用检索"到"面向生成任务的定制化检索"的转变。
关键突破点:将LLM的隐性偏好显性化为可训练的奖励信号,解决了检索器与生成器之间的"认知鸿沟"问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术实现细节剖析
2.1 四阶段训练框架
2.1.1 训练数据生成阶段
- 候选示例采样:使用基础检索器(如BM25)从示例库中召回n个候选
- LLM反馈收集:计算每个候选示例d_i与查询x拼接后,目标输出y的对数似然概率:
math复制r_i = \log P_{\mathcal{M}}(y | x, d_i) - 数据标注:形成三元组{(x, d_i, r_i)},其中r_i反映了LLM对示例的"偏好程度"
2.1.2 奖励建模阶段
采用交叉编码器架构,通过对比学习训练奖励模型:
- 正样本:r值最高的示例
- 负样本:其他候选示例
- 损失函数:
math复制\mathcal{L}_{RM} = - \log \frac{\exp(s^+ / \tau)}{\exp(s^+ / \tau) + \sum_{j=1}^{m} \exp(s_j^- / \tau)}
2.1.3 知识蒸馏阶段
将交叉编码器的能力迁移到高效的双编码器:
- 定义教师(交叉编码器)和学生(双编码器)的概率分布
- 使用KL散度进行分布对齐:
math复制\mathcal{L}_{distill} = \text{KL}(P_T || P_S) - 采用混合损失函数:
math复制\mathcal{L}_{total} = \alpha \mathcal{L}_{distill} + (1-\alpha)\mathcal{L}_{cont}
2.1.4 评估与应用阶段
- 向量化检索:
