1. 项目背景与核心价值
大型语言模型(LLM)的指令遵循能力直接决定了其在实际应用中的可用性。传统方法通常采用监督微调(SFT)和基于人类反馈的强化学习(RLHF)两阶段训练,但这种方式存在两个显著痛点:首先,RLHF阶段需要大量高质量的人类偏好数据,收集成本极高;其次,模型在复杂指令下的泛化能力往往不足,容易产生"表面服从但实质偏离"的响应。
浙江大学提出的指令重写训练策略(Instruction Rewriting Training,简称IRT)创新性地将指令优化过程融入模型训练本身。其核心思想是:让模型在接收初始指令后,先主动生成优化版的指令,再基于优化指令生成最终响应。这种方法不仅提升了模型对模糊指令的理解能力,还显著降低了对外部人工标注的依赖。
关键突破:IRT使单轮SFT训练就能达到甚至超越传统SFT+RLHF组合的效果,在AlpacaEval基准测试中仅用7B参数模型就实现了ChatGPT(GPT-3.5-turbo)85.3%的胜率。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术实现深度解析
2.1 整体架构设计
IRT采用双阶段自监督训练框架:
- 指令重写阶段:模型接收原始指令$I_{raw}$,输出优化指令$I_{refined}$
- 响应生成阶段:基于$I_{refined}$生成最终响应$R_{final}$
训练时采用联合损失函数:
$$
\mathcal{L} = \lambda \mathcal{L}{rewrite} + (1-\lambda)\mathcal{L}
$$
其中$\lambda$控制两个任务的权重平衡(实验表明0.3-0.4效果最佳)
2.2 关键训练技巧
2.2.1 种子指令构建
构建高质量的初始训练集需要特殊处理:
- 从Alpaca、Dolly等开源数据集中筛选5-15词的简洁指令
- 对每条指令人工标注3种典型缺陷类型:
- 模糊性(如"解释这个")
- 歧义性(如"展示结果")
- 信息不全(如"写首诗"缺少风格要求)
2.2.2 重写质量评估
设计自动化评估指标避免人工标注:
- 指令完整性得分:
$$ S_{comp} = \frac{|E_{refined}|}{|E_{raw}|} $$
