1. 项目背景与核心问题
在深度学习模型训练过程中,我们经常会观察到这样一个现象:使用相同架构但不同初始化的模型,经过独立训练后,最终会收敛到性能相近但参数不同的解。传统观点认为这些解位于损失函数的不同"盆地"(basin)中,彼此之间被高损失屏障隔开。但近年来研究发现,这些看似分离的解实际上可以通过低损失路径相连,这种现象被称为线性模式连通性(Linear Mode Connectivity, LMC)。
然而,参数空间的对称性(如神经元排列顺序的置换对称性)使得功能等效的模型在参数空间中看起来差异很大。现有方法主要关注通过排列(permutation)实现的神经元重排序,但这种方法的适用范围有限,难以捕捉Transformer等现代架构中更丰富的对称性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 广义线性模式连通性框架
2.1 对称性类别扩展
我们提出了一个统一框架,涵盖四类对称性变换:
- 排列(Permutations):传统的神经元重排序
- 半排列(Semi-permutations):允许神经元的部分重映射
- 正交变换(Orthogonal transformations):保持范数不变的线性变换
- 一般可逆映射(General invertible maps):最广泛的参数重参数化方式
这个框架的一个重要特性是,它能够将许多先前的方法作为特例包含在内。例如,当限制在排列变换时,我们的方法就退化为传统的LMC方法。
2.2 Transformer架构的特殊考量
Transformer模型由于其独特的结构,展现出比传统全连接网络更复杂的对称性:
- 多头注意力机制中的头排列对称性
- 前馈网络中隐藏单元的排列对称性
- 层与层之间的某些正交变换对称性
我们的框架能够自然地捕捉这些对称性,这是传统方法无法做到的。具体来说,对于Vision Transformer(ViT)和GPT-2等模型,我们首次实现了:
- 独立训练模型间的低/零障碍线性插值路径
- 不同大小架构间的对齐(宽度异构设置)
- 多模型联合对齐(超过两个模型的情况)
3. 实现方法与技术细节
3.1 对称性感知对齐算法
我们开发了一种高效的对称性感知对齐算法,其核心步骤如下:
- 对称性检测:
- 分析模型架构,识别潜在的对称性类别
