1. 引言:重新思考long-CoT SFT的数据策略
在大型语言模型的监督微调(SFT)领域,特别是针对长链推理(long-CoT)任务的微调,我们长期以来被一个看似不言自明的假设所主导:更多的数据意味着更好的性能。这个假设源自预训练阶段的经验,在那里数据多样性确实是模型泛化能力的关键。然而,当我们把目光转向SFT阶段,尤其是处理需要复杂多步推理的任务时,这个假设可能需要重新审视。
最近来自纽伦堡工业大学、Mistral AI和英伟达的研究团队通过系统实验发现,在long-CoT SFT中,重复利用少量高质量数据进行多轮训练,其效果显著优于不断扩充新数据的策略。这一发现不仅挑战了行业常规做法,也为资源受限的团队提供了更高效的训练路径。本文将深入解析这项研究的关键发现,并探讨其背后的原理和实践意义。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 实验设计与方法论解析
2.1 研究框架与核心问题
研究团队设计了严谨的实验来回答一个核心问题:在固定的计算预算下,我们应该如何分配"数据规模"和"训练轮次"这两个关键资源?具体而言,给定相同的梯度更新次数(51,200次),是应该:
- 使用51,200个样本训练1轮?
- 使用25,600个样本训练2轮?
- 还是使用更少的样本(如3,200个)但训练更多轮次(16轮)?
这种实验设计巧妙地隔离了计算预算的影响,使我们能够纯粹比较数据策略的差异。
2.2 模型与数据集选择
研究选用了三个具有代表性的开源基座模型:
- Qwen3-4B 和 Qwen3-8B(来自阿里云)
- Olmo3-7B(来自Allen AI)
数据集方面,基于Dolci SFT 7B构建了具有严格嵌套结构的训练集:
code复制200 ⊂ 400 ⊂ 800 ⊂ 1.6k ⊂ 3.2k ⊂ 6.4k ⊂ 12.8k ⊂ 25.6k ⊂ 51.2k
这种设计确保了不同规模数据集之间的可比性,排除了数据质量差异的干扰。
2.3 评测基准与指标
评估采用了两个需要深度推理的挑战性任务:
- AIME 2024/2025:美国数学竞赛邀请赛级别的问题
- GPQA:研究生水平的综合问答
评测设置考虑了实际应用场景:
- 每个问题生成多个响应(AIME:16次,GPQA:4次)
- 最大生成长度达30k tokens,
