1. 现代LLM注意力机制演进全景
在大型语言模型(LLM)的发展历程中,注意力机制始终扮演着核心角色。从最初的Transformer架构到如今百花齐放的变体,注意力机制的创新直接推动了模型性能的突破。本文将系统解析七种主流注意力变体的技术原理与实现细节,包括:
- 经典多头注意力(MHA)
- 分组查询注意力(GQA)
- 多头潜空间注意力(MLA)
- 滑动窗口注意力(SWA)
- DeepSeek稀疏注意力(DSA)
- 门控注意力
- 混合注意力架构
每种机制都针对特定场景进行了优化,理解它们的差异对模型选型和调优至关重要。我们将通过计算流程图、参数对比表和实际模型案例,揭示这些机制背后的设计哲学。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 多头注意力(MHA):奠基者的智慧
2.1 自注意力机制的本质
自注意力机制的核心思想是允许序列中的每个token动态关注其他相关token。给定输入序列X∈ℝ^(T×d),其中T为序列长度,d为嵌入维度,自注意力通过三个可学习矩阵W_q、W_k、W_v∈ℝ^(d×d_k)计算查询(Q)、键(K)和值(V):
Q = XW_q, K = XW_k, V = XW_v
注意力权重A的计算采用缩放点积形式:
A = softmax(QK^T/√d_k)
最终输出为加权值向量:
Z = AV
关键点:softmax的温度系数√d_k防止梯度消失,这是Transformer稳定训练的关键设计。
2.2 多头并行的奥秘
MHA将上述过程并行化,使用h个独立的注意力头。每个头有专属的投影矩阵W_q^i, W_k^i, W_v^i∈ℝ^(d×d_k),其中d_k = d/h。多头输出的拼接与线性变换:
Z = Concat(Z_1,...,Z_h)W_o
典型配置如GPT-3的96头注意力,每头维度d_k=128(总d=12288)。
表:MHA在不同模型中的典型配置
| 模型 | 头数(h) | 头维度(d_k) | 总参数量 |
|---|
