1. Transformer:大模型时代的基石架构
2017年,Transformer架构的诞生彻底改变了自然语言处理的游戏规则。这种基于自注意力机制的模型结构,在机器翻译任务中首次展现出超越传统RNN/CNN模型的性能。其核心创新在于:
1.1 自注意力机制的工作原理
自注意力机制允许序列中的每个位置(token)直接与序列中所有其他位置建立联系,通过三个关键矩阵实现:
- Query(Q):表示当前token的"询问"向量
- Key(K):表示其他token的"标识"向量
- Value(V):包含实际信息内容的向量
计算过程分为四步:
- 计算注意力分数:Score = Q·K^T / √d_k
- 应用softmax归一化
- 加权求和得到输出:Attention = softmax(Score)·V
- 多头机制并行执行上述过程
这种设计带来了两个革命性优势:
- 完美的并行计算能力:不再受限于RNN的时序依赖
- 直接建模长程依赖:任意距离的token间都可直接交互
1.2 Transformer的架构组成
标准Transformer由以下组件构成:
- 编码器堆栈(N×相同层)
- 多头自注意力子层
- 前馈神经网络子层(FFN)
- 残差连接和层归一化
- 解码器堆栈(N×相同层)
- 带掩码的多头自注意力
- 编码器-解码器注意力
- 前馈神经网络子层
其中,FFN通常实现为两层全连接网络,中间维度是输入维度的4倍(如GPT-3中d_model=12288,d_ff=49152)。
1.3 规模扩展带来的挑战
随着模型参数量的增长,传统Transformer架构面临三个主要瓶颈:
-
计算冗余问题:
- 无论输入复杂度如何,都激活全部参数
- 简单任务也消耗与复杂任务相同的计算资源
- 研究表明,前向传播中约70%的神经元激活是冗余的
-
训练成本激增:
- FLOPs与参数量呈线性关系
- GPT-3 175B模型单次训练需3.14E23次浮点运算
- 训练成本从数百万到数千万美元不等
-
收益递减效应:
- Chinchilla定律表明:在固定计算预算下
- 更大模型+更少数据
