1. 项目概述:Transformer模型的广义线性模式连通性
在深度学习领域,Transformer架构已经成为自然语言处理和计算机视觉任务的事实标准。然而,当我们训练多个相同架构的Transformer模型时,一个有趣的现象出现了:这些独立训练的模型在参数空间中可以找到低障碍甚至零障碍的连通路径,尽管它们看起来位于不同的损失盆地中。这就是2025年NIPS会议上提出的"广义线性模式连通性"(Generalized Linear Mode Connectivity)研究的核心课题。
传统方法主要关注通过神经元排列实现的参数空间对称性,但这种视角过于局限。我们的工作首次构建了一个统一框架,能够处理四类对称性变换:排列、半排列、正交变换和一般可逆映射。这个突破使得我们能够在Vision Transformers和GPT-2这类现代架构中发现低障碍连通路径,甚至在不同规模的模型之间建立连接。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心概念解析
2.1 线性模式连通性(LMC)的本质
线性模式连通性描述的是:在神经网络的参数空间中,两个独立训练的模型θ₁和θ₂之间存在一条路径γ(t) = (1-t)θ₁ + tθ₂,使得沿着这条路径的损失函数值保持较低水平。这种现象最初在简单全连接网络中被观察到,但在Transformer架构中表现得更为复杂。
关键洞察:LMC的存在暗示着不同训练结果可能实际上属于同一个"解决方案簇",只是由于参数空间的对称性而表现为不同的形式。
2.2 Transformer特有的对称性挑战
Transformer架构引入了多种新的对称性来源,使得传统的排列对齐方法失效:
- 多头注意力机制的并行性:不同注意力头之间具有可交换性
- 层归一化的尺度不变性:参数可以按特定比例缩放而不改变函数行为
- 残差连接的路径对称性:信息流可以通过不同路径等效传递
我们的框架通过引入半排列(允许维度的分裂与合并)和正交变换,成功捕获了这些复杂对称性。
3. 方法论深度剖析
3.1 统一对称性框架的数学表述
我们定义广义重参数化变换为可逆映射φ,使得对于任何参数θ,有:
f_θ = f_{φ(θ)} ∘ g
其中g是一个简单的可逆函数(如线性变换)。这个框架包含四个关键子类:
- **排列对称性
