1. 从Seq2Seq到Transformer:LLM的进化起点
2014年诞生的Seq2Seq模型首次实现了端到端的序列学习能力,但它的核心瓶颈在于固定长度的上下文向量。想象一下试图用一张便利贴总结整本《战争与和平》的情节——这就是早期机器翻译面临的困境。2015年Bahdanau提出的注意力机制如同给了模型一支荧光笔,允许动态标注输入序列的关键部分。但真正的革命要等到2017年《Attention is All You Need》论文的发表。
Transformer架构的三大支柱彻底改变了游戏规则:
- 自注意力机制让每个词元都能直接"看到"序列中的任意位置
- 位置编码为无状态的模型注入了序列顺序信息
- 残差连接使得深层网络训练成为可能
这个架构的扩展性令人震惊。当我们将参数规模从最初的6500万(BERT-base)提升到1750亿(GPT-3)时,模型开始展现出涌现能力——那些在小规模模型中不存在的新能力。这就像蚁群个体简单,但群体却能构建复杂巢穴的现象。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 注意力机制的演进图谱
2.1 标准多头注意力(MHA)的运作机理
MHA就像会议室里的多专家讨论组。假设处理句子"The animal didn't cross the street because it was too tired":
- 每个注意力头会聚焦不同关系:
- Head1关注"it"与"animal"的指代关系
- Head2捕捉"because"表达的因果关系
- Head3关联"tired"与"animal"的状态描述
数学表达上,给定查询Q、键K、值V:
[ \text{Attention}(Q,K,V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})V ]
其中除以√dk的缩放防止点积过大导致softmax饱和。
2.2 高效注意力变体的设计哲学
当处理长序列时,标准MHA的O(n²)复杂度成为瓶颈。以下是三种主流优化方案:
| 类型 | 参数共享方式 | 显存占用 | 典型应用 |
|---|---|---|---|
| MHA | 无共享 | 高 | BERT、GPT |
| MQA | 所有头共享 |
