1. 从Kaplan到Chinchilla:大模型训练数据量的演进逻辑
三年前Jeffrey Kaplan那篇划时代的Scaling Laws论文(2020)给AI社区带来了一个震撼结论:7B参数规模的模型,在训练数据量达到21.5B tokens时会出现明显的loss拐点(D_turn),当数据量接近96.5B tokens时模型性能将进入平台期(D_plateau)。这个结论在当时看起来非常合理——毕竟用不到100B tokens就能充分训练一个7B模型,性价比简直令人惊喜。
但现实发展总是充满戏剧性。如今当我们查看Llama 2-7B、Mistral-7B等主流开源模型的训练日志时,会发现它们的实际训练数据量普遍达到了2T甚至3T tokens,比Kaplan建议的量高出20-30倍!这种"数据膨胀"现象背后,其实是DeepMind在2022年提出的Chinchilla定律对原有认知的颠覆性修正。
关键转折点:Chinchilla论文通过更精确的实验设计证明,Kaplan当年观察到的"平台期"实际上是计算预算受限导致的假象。当采用最优的"计算-数据-参数"配比时,模型性能会随着数据量增加持续提升,根本不存在所谓的绝对平台阈值。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Kaplan原始结论的局限性解析
2.1 实验设计的历史约束
Kaplan团队在2020年的研究中存在几个关键限制条件:
- 最大模型规模仅做到13B参数(受当时硬件条件限制)
- 训练数据上限为300B tokens(受数据集规模限制)
- 固定计算预算下的对比实验(FLOPs总量受限)
这些约束导致他们只能观察到局部最优解。就像用望远镜观察星空时,如果镜头直径不够大,就会误以为某些星星的亮度已经达到极限。下表对比了两种研究的关键差异:
| 维度 | Kaplan(2020) | Chinchilla(2022) |
|---|---|---|
| 最大参数量 | 13B | 70B |
| 最大数据量 | 300 |
