1. 项目概述:DRIFT框架的核心价值与创新
在当今大语言模型(LLMs)应用中,处理长上下文文档一直是个棘手问题。传统方法要么受限于上下文窗口长度,要么面临计算资源爆炸式增长的困境。DRIFT框架的创新之处在于,它像是一个高效的"信息过滤与浓缩"系统——轻量级的知识模型充当专业的信息萃取师,从海量文本中精准提取关键事实;而强大的推理模型则如同经验丰富的分析师,专注于基于这些浓缩信息进行深度思考。
这种分工模式带来了三个显著优势:首先,在256k token的超长文档上实现了约7倍的推理加速,这意味着原本需要1分钟处理的文档现在只需8-9秒;其次,通过32倍压缩比,不仅没有损失信息质量,反而在LongBench-v2基准测试中将准确率从20.87%提升到29.22%;最重要的是,这种解耦设计使得系统可以灵活适应不同规模的模型组合,为实际部署提供了更多可能性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构深度解析
2.1 双模型协同工作机制
DRIFT框架的核心在于知识模型(ψ_kno)与推理模型(θ_rea)的精密配合。知识模型通常选择参数量较小的模型(如1B-3B参数),它的角色类似于专业的信息筛选员,负责快速扫描文档并标记关键信息。这个模型会为每个文本块生成固定数量的隐式事实token(通常为8-32个),这些token不是简单的关键词提取,而是包含了丰富语义关系的潜在空间表示。
推理模型则承担着"思考者"的角色,通常采用7B及以上参数量的强大模型。特别值得注意的是两个模型间的投影器(MLP projector),它就像专业的翻译官,将知识模型输出的隐式事实转换为推理模型能够理解的"语言"。这种设计使得两个模型可以独立更新和优化,大大提升了系统的灵活性和可维护性。
2.2 动态压缩的关键创新
与传统压缩方法不同,DRIFT引入了两项突破性设计:
桶式压缩(Bucketed Compression):系统不是简单地按固定比例压缩所有文本,而是根据输入长度划分多个区间(如0-4k、4k-8k、8k-16k等),每个区间采用不同的压缩策略。这种方法更符合实际场景中信息分布不均匀的特点,避免了"一刀切"带来的信息损失。
查询感知的动态压缩:当用户提出具体问题时,知识模型会像经验丰富的侦探一样,只保留与问题直接相关的证据。在实际测试中,
