1. 项目背景与核心问题
在当前的AI领域,大型语言模型(LLM)展现出了惊人的推理能力,但其高昂的计算成本让许多实际应用望而却步。以GPT-4为例,单次推理可能需要数十GB的显存和数秒的响应时间。与此同时,小型模型虽然响应迅速、成本低廉,但在复杂任务上的表现往往不尽如人意。
传统解决方案采用"级联路由"策略:通过一个额外的分类器判断问题难度,简单问题交给小模型,难题则完全转交给大模型。这种方案存在两个明显缺陷:
-
判断粒度粗糙:很多所谓的"难题"中,90%的推理步骤小模型都能胜任,仅在少数关键节点需要帮助。全盘转交就像因为一道数学题的最后一个步骤不会,就让教授从头到尾重新解答整道题。
-
额外开销:路由模块本身需要计算资源,而且其判断准确率直接影响系统整体表现。实际测试表明,这类方案中约有15-30%的问题会被错误分类。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. RelayLLM的创新设计
2.1 核心思路:token级协作
RelayLLM的核心突破在于将协作粒度细化到token级别。其工作流程可以类比师生互动:
- 小模型(学生):负责大部分常规推理
- 大模型(老师):仅在关键节点提供精准指导
- 特殊指令:
<call>n</call>表示需要大模型生成n个token
这种设计实现了三个关键优势:
- 动态性:不需要预先判断整个问题难度
- 精准性:可以精确控制求助位置和时长
- 可学习性:求助策略可以通过训练优化
2.2 技术实现细节
2.2.1 协作推理机制
具体实现包含三个关键阶段:
-
小模型主导生成:
- 默认由小模型进行自回归生成
- 可主动插入
<call>50</call>等指令 - 指令中的数字表示需要大模型生成的token数量
-
大模型干预:
- 系统检测到指令后暂停小模型
- 将当前上下文(不含指令)传给大模型
- 大模型生成指定数量的token
-
控制权回归:
- 大模型完成生成后交还控制权
- 小模型继续处理,保留完整历史记录
关键细节:指令本身会被保留在生成历史中,这使得小模型能记住自己的决策过程,形成连贯的推理链条。
