1. 大模型训练中的Mid-Training技术深度解析
在大型语言模型(LLM)的训练过程中,Mid-Training(中间训练)阶段正逐渐成为提升模型性能的关键环节。这个位于预训练和微调之间的特殊阶段,通过精细化的训练策略调整,能够显著提升模型在推理、编程和长文本理解等高级任务上的表现。
1.1 Mid-Training的核心价值
Mid-Training的核心价值在于它能够引导模型从"知识记忆"向"抽象推理"的能力转变。传统的大规模预训练虽然让模型掌握了广泛的知识,但这些知识往往是表面和分散的。通过Mid-Training阶段的精细化调整,模型能够更好地组织和运用这些知识,实现质的飞跃。
从技术角度看,Mid-Training主要关注三个关键维度:
- 数据分布的精细化调整
- 学习率调度的系统化设计
- 上下文长度的渐进式扩展
这三个方面相互配合,共同构成了Mid-Training的技术框架。下面我们将逐一深入分析每个维度的技术细节和实现方法。
1.2 Mid-Training的技术演进
Mid-Training的概念并非一蹴而就,而是随着大模型训练实践的发展逐步形成的。早期的模型如GPT-3主要采用简单的两阶段训练流程(预训练+微调),但随着模型规模的扩大和任务复杂度的提升,研究人员发现单纯的规模扩展带来的边际效益正在递减。
下表展示了主流模型采用Mid-Training策略的演进历程:
| 模型世代 | 训练策略特点 | 性能提升关键 |
|---|---|---|
| GPT-3时代 | 简单两阶段训练 | 主要依赖数据量和模型规模 |
| LLaMA时代 | 引入数据质量筛选 | 高质量数据开始受到重视 |
| GPT-4时代 | 系统化Mid-Training | 三阶段训练成为标配 |
| 当前前沿 | 动态自适应Mid-Training | 训练过程根据模型状态实时调整 |
这种演进反映了业界对大模型训练规律认识的不断深化,也凸显了Mid-Training在现代LLM开发中的核心地位。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据分布的精细化策略
2.1 数据质量优先原则
Mid-Training阶段最显著的特点就是从"数量优先"转向"质量优先"。在预训练阶段,模型接触的主要是海量但质量参差不齐的网页数据,这些数据虽然覆盖面广,但信号密度低,不利于高级认知能力的培养。
Mid-Training阶段通常会采用以下几类高质量数据源:
-
高质量过滤网页数据:如CommonCrawl、C4等经过多轮筛选的语料,相比原始数据具有更低毒性、更高教育价值和更小冗余度。
-
代码与数学内容:Stack Overflow、OpenWebMath等数据集提供了符号推理和程序合成的密集训练信号。研究表明,FineMath这类包含逐步推理标注的数据能使模型在GSM8K上的性能提升2倍,在MATH上提升6倍。
-
指令风格与问答数据:Ultrachat、EvolInstruct等数据集通过问题-答案对增强模型对人类意图的理解能力。
2.2 主流模型的数据策略比较
不同模型在Mid-Training阶段采用了差异化的数据配比策略,以下是一些典型案例:
-
Qwen3的三阶段训练:
- 第一阶段:30T Token覆盖119种语言建立基础
- 第二阶段:5T高质量Token增加STEM、代码和推理数据比例
- 第三阶段:数百亿Token的长上下文训练(75%为16K-32K样本,25%为4K-16K样本)
-
Phi-4的两阶段预训练:
- 第一阶段:10T Token以过滤网页数据为主
- 第二阶段:增加合成Token和超高质量推理导向数据
- Mid-Training阶段:用75B精选长上下文Token和175B召回Token进行强化
-
LLaMA 3 405B:
- 15T多语言Token训练
- 数据配比:50%通用知识、25%数学推理、17%代码和8%多语言
- 退火阶段:最后40M Token上采样最高质量源
下表对比了主流模型在Mid-Training阶段的数据配置:
| 模型 | 通用预训练 | 退火阶段 | 长上下文 | 数据类型(退火+长上下文) |
|---|---|---|---|---|
| Nemotron-4 | 8T | 1T | - | 高质量Web、代码、数学、指令 |
| MiniCPM | 1T | 20B | - | 高质量Web、指令、合成数据 |
| Phi-4 | 10T | - | 250B | 高质量Web、合成数据、推理数据 |
| DeepSeek-V3 | 14.8T | - | 120B | FIM数据 |
| LLaMA3-405B | 15T | 40B | 800B | 通用知识、代码、数学、多语言 |
2.3 数据策略的关键发现
通过对这些模型实践的分析,我们可以总结出几条关键发现:
-
高质量内容的杠杆效应:结构化教育、数学和编程数据替换低信号网页文本能持续提升性能,表明高质量领域聚焦语料在后期训练中提供更强监督信号。
-
数据时机的敏感性:指令风格数据在Mid-Training早期添加比推迟到微调阶段更有效,但边际收益会递减,需要找到最佳放置时机。
-
长上下文数据的平衡:仅用长数据训练会损害性能,必须与高质量短上下文数据保持平衡混合。自然长文本内容(如书籍和代码仓库)在长上下文推理上好于人工拼接数据。
-
合成数据的价值:定制化合成数据可以强调欠表示领域、复杂推理或结构化格式,有效补偿自然文本的局限性。
3. 学习率调度的系统化设计
3.1 学习率调度的重要性
学习率调度是Mid-Training的第二大支柱,直接影响优化稳定性、收敛速度和泛化性能。在Mid-Training阶段,模型参数已经具备较好的初始值,此时精细的学习率调整能够帮助模型更有效地吸收高质量数据中的知识。
不当的学习率调度可能导致两种问题:
- 学习率过高:模型在优良参数区域附近震荡,无法稳定收敛
- 学习率过低:训练进程缓慢,计算资源浪费
3.2 主流学习率调度器类型
研究将主流调度器分为七类,每种都有独特的衰减模式和适用场景:
-
线性调度器:
- 公式:η_t = η_max - (η_max - η_min)·t/T
- 特点:简单直接,被证明在大批量训练中有效
-
余弦调度器:
- 公式:η_t = η_min + 0.5(η_max - η_min)(1 + cos(πt/T))
- 特点:平滑衰减,被GPT-3、Gopher等多个主流模型采用
-
指数调度器:
- 公式:η_t = η_max·γ^t
- 特点:通过固定衰减因子逐步降低学习率,适合长期稳定优化
-
膝点调度器:
- 策略:初始阶段恒定高学习率探索,随后线性衰减至零
- 特点:受宽最小值密度假设启发,无需额外超参数
-
循环调度器:
- 公式:η_t = η_min + (η_max - η_min)·max(0, 1 - |2t/C - 1|)
- 特点:在边界值间循环变化,减少超参数搜索需求
-
WSD调度器:
- 三阶段设计:预热→稳定→衰减
- 特点:特别适合Mid-Training引入高质量数据时使用
-
Power调度器:
- 公式:η_t = η_max·(B/N)^α
- 特点:结合幂律关系和μP,实现跨超参数的零样本迁移
3.3 主流模型的学习率策略
下表展示了主流模型采用的学习率调度策略:
| 模型 | 学习率衰减策略 | 学习率路径 | 优化器 | 分阶段训练 |
|---|---|---|---|---|
| GPT-3 | Cosine | 6e-4 → 6e-5 | Adam | ✗ |
| Gopher | Cosine | 1e-7 → 4e-5 → 4e-6 | Adam | ✗ |
| LLaMA | Cosine | 1.5e-4 → 1.5e-5 | AdamW | ✗ |
| MiniCPM | WSD | 0 → 0.01 → 0.01·f(s-T) | Adam | ✓ |
| LLaMA3 | Cosine→Linear | 8e-5 → 8e-7 → 0 | AdamW | ✓ |
3.4 学习率调度的关键发现
-
预热阶段的重要性:已知可缓解早期训练的梯度不稳定性和损失尖锐度,支持使用更大峰值学习率。
-
衰减策略的多样性:虽然余弦退火广泛采用,但实证显示线性衰减在某些设置下可产生更优收敛和泛化。
-
缩放定律的应用:经验缩放定律为跨模型大小和训练机制选择学习率提供实用指导,尽管仍不完整。
-
调度器的选择依赖系统:衰减策略的有效性与批量大小、模型规模和优化器动力学等因素复杂交互,需要针对具体场景调整。
4. 长上下文扩展的技术框架
4.1 长上下文扩展的挑战
将模型的有效处理窗口从4K-8K扩展到128K甚至百万级Token面临核心挑战:位置编码的外推问题。模型在训练时只见过较短序列,推理时遇到超长序列会导致位置信息混乱。
4.2 RoPE位置编码基础
Rotary Position Embedding (RoPE) 是当前主流的位置编码方案,其核心思想是将查询向量和键向量在嵌入空间的多个二维子平面内旋转,旋转角度与位置索引成正比。
数学表达:
对于位置m的查询q_m和键k_n,旋转后为:
f(q_m, m) = R_m q_m
f(k_n, n) = R_n k_n
其中R是正交旋转矩阵,满足R_m^T R_n = R_{n-m},因此注意力分数仅依赖相对位置m-n。
4.3 主流扩展方法
研究提出了统一的频率重映射框架,将主流方法表达为对RoPE基础频率的变换:
-
位置插值(PI):
- 策略:均匀重缩放s = L'/L
- 优点:简单、微调轻量
- 缺点:大s时短上下文质量下降
-
NTK感知插值:
- 策略:s_d = s^(d/(d-2))
- 优点:比PI更好的局部性保持
- 缺点:超参数耦合
-
NTK分段插值:
- 策略:维度特定比率,低频PI式插值,高频保持不变
- 优点:强短上下文保留
- 缺点:更多边界需设置
-
YaRN:
- 策略:增加长度相关logit温度缩放
- 优点:快速扩展至128K的高效路径
- 缺点:额外温度选择
-
LongRoPE:
- 策略:非均匀重缩放,学习不同缩放因子
- 优点:可达约2M上下文
- 缺点:流程复杂
4.4 主流模型的长上下文实现
下表展示了主流模型的长上下文扩展技术:
| 模型 | 最大长度 | 扩展技术 | 架构辅助 | 长上下文数据源 |
|---|---|---|---|---|
| InternLM2 | 32k | ABF | GQA | 书籍、专利、论文 |
| DeepSeek-V2 | 128k | YaRN | MLA, MoE | - |
| LLaMA-3.1 | 128k | ABF+YaRN | GQA | - |
| Qwen-2.5 | 128k/1M | ABF+YaRN+DCA | 稀疏注意力 | - |
4.5 长上下文扩展的关键发现
-
频率重映射和温度缩放统一了大多数方法:长上下文方案可建模为修改RoPE基础角度的频率重映射和应用于softmax的可选长度温度缩放。
-
全局范围与局部保真度的权衡:纯插值均匀拉伸所有频率但可能在长距离模糊局部线索,NTK方法保留高频带以保持短距离结构。
-
架构辅助的重要性:交错全局局部注意力、GQA/MLA和稀疏注意力主要减少KV缓存和内存成本,与频率重映射良好配合。
-
有效配方:渐进式扩展窗口(s = L_t/L_{t-1} ≈ 2),退火学习率,混合长短Token(通常30-60%长)配合合成任务。
5. Mid-Training的性能提升与实操建议
5.1 性能提升的三个维度
研究汇总了20余个主流模型在Mid-Training后的性能提升数据,可以归纳为三大维度:
-
高级推理与适应性:
- DeepSeek-v2在MiniF2F测试集上达到88.9%通过率
- Phi-4在STEM问答上显著超越教师模型
- Zamba用1T Token达到LLaMA2(2T)性能
-
可扩展效率:
- MiniCPM4仅用Qwen3的22% Token达到可比性能
- LLaMA3退火使8B模型在GSM8K上提升24.0%
- SmolLM3在3B规模达到SOTA
-
可靠基础:
- OLMo2的Mid-Training使7B提升10.6分
- Hunyuan-Large在下游任务性能显著提升
- PanguProMoE退火阶段带来大幅改进
5.2 Mid-Training实操建议
基于现有研究和实践经验,我们总结出以下Mid-Training实操建议:
-
数据策略:
- 建立多层次数据质量评估体系
- 采用渐进式数据混合策略
- 重视代码和数学数据的杠杆效应
- 平衡长短上下文数据比例
-
学习率调度:
- 小模型更适合激进的学习率衰减
- 大模型需要更谨慎的调度设计
- 考虑采用WSD或Power等新型调度器
- 监控损失曲线及时调整
-
长上下文扩展:
- 采用渐进式窗口扩展策略
- 优先考虑NTK感知或YaRN方法
- 配合适当的架构优化
- 保持短上下文性能验证
-
训练监控:
- 建立多维度的评估体系
- 定期检查中间checkpoint性能
- 设置自动回滚机制
- 记录完整的训练元数据
5.3 未来发展方向
尽管Mid-Training已显示出显著价值,但仍有许多开放问题需要探索:
-
动态自适应训练:根据模型状态实时调整训练策略,而非固定计划。
-
理论框架构建:从优化理论和学习动力学角度深入理解Mid-Training的有效性。
-
多模态扩展:将Mid-Training理念应用于视觉-语言等多模态模型。
-
高效化技术:降低Mid-Training的计算成本,提高资源利用效率。
-
自动化工具:开发支持自动Mid-Training策略搜索和优化的工具链。
Mid-Training已经从最初的经验性技巧发展为系统化的训练范式,随着研究的深入和实践的积累,它将继续在大模型开发中扮演关键角色,推动模型性能不断突破新的边界。
