1. 大模型自蒸馏现象的本质剖析
去年我在微调一个7B参数量的开源大模型时,意外发现一个有趣现象:当采用自蒸馏技术(Self-Distillation)对模型进行迭代训练后,模型输出的置信度评分显著提升,但在实际推理任务中的表现却不升反降。这个反直觉的结果促使我深入研究了自蒸馏对模型不确定性的影响机制。
自蒸馏本质上是通过让模型学习自身输出分布来实现知识提炼。具体操作时,我们会用教师模型(原始模型)对未标注数据生成伪标签,再用这些伪标签训练学生模型(相同结构的副本)。经过多轮迭代后,模型确实会表现出更"自信"的行为——其输出的概率分布更加尖锐,top-1预测的置信度经常接近1.0。
但问题在于,这种表面上的"自信"是通过压缩概率分布实现的。原本模型对困难样本应有的不确定性表达被强行压制了。举个例子,在数学推理任务中,面对"若x+3=8且y-2=x,求y值"这类题目,原始模型可能给出:
- 选项A:7(置信度0.65)
- 选项B:5(置信度0.25)
- 选项C:9(置信度0.10)
而经过自蒸馏的模型输出则变为:
- 选项A:7(置信度0.95)
- 选项B:5(置信度0.04)
- 选项C:9(置信度0.01)
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 不确定性在推理中的核心作用
2.1 认知不确定性与偶然不确定性
在概率机器学习中,不确定性通常分为两类:
- 认知不确定性(Epistemic Uncertainty):源于模型知识不足,可通过更多数据/训练缓解
- 偶然不确定性(Aleatoric Uncertainty):数据本身的噪声特性,无法通过更多数据消除
健康的模型应该保持对这两类不确定性的敏感度。在复杂推理任务中,适度的不确定性表达实际上是模型在进行自我校验。当我们观察人类解题过程时,也会在遇到模糊条件时自然产生犹豫,这种犹豫促使我们检查前提假设或尝试替代解法。
2.2 自蒸馏如何破坏不确定性表达
自蒸馏过程中存在三个关键效应:
- 标签平滑的逆向操作:传统蒸馏使用温度系数τ软化输出分布,而自蒸馏的迭代过程实际上在进行"分布锐化"
- 错误累积效应:教师模型的预测错误会作为伪标签传递给学生模型,在多轮迭代中不断放大
- 模型坍塌:输出分布逐渐退化到少数几个高置信度模式,丧失多样性
通过实验跟
