1. Transformer架构革命:从Seq2Seq到自注意力机制
2017年Google发表的《Attention Is All You Need》论文彻底改变了自然语言处理领域的游戏规则。Transformer架构摒弃了传统的循环神经网络(RNN)和卷积神经网络(CNN),完全基于注意力机制构建。这种设计在机器翻译任务中首次展现出惊人效果,随后迅速成为NLP领域的标准架构。
1.1 自注意力机制工作原理
自注意力机制的核心在于计算输入序列中每个元素与其他所有元素的相关性。具体实现时,每个输入token会生成三个向量:
- Query向量(查询当前token的关注点)
- Key向量(表示其他token的可被关注特征)
- Value向量(实际传递的信息内容)
计算过程可分为四步:
- 通过线性变换生成Q、K、V矩阵
- 计算Q与K的点积并缩放(除以√d_k,d_k为key维度)
- 应用softmax归一化得到注意力权重
- 用权重对V加权求和得到输出
这种设计使得模型能够动态关注不同位置的token,解决了RNN长距离依赖问题。例如在句子"The animal didn't cross the street because it was too tired"中,"it"可以准确关联到"animal"而非"street"。
1.2 多头注意力与位置编码
标准Transformer采用多头注意力(Multi-Head Attention)扩展模型能力。典型配置使用8个注意力头,每个头学习不同的关注模式:
- 有的头关注局部语法关系
- 有的头捕捉长距离语义关联
- 有的头识别特定词性关系
由于自注意力本身不包含位置信息,Transformer通过位置编码(Positional Encoding)注入序列顺序。常用正弦余弦函数生成位置编码:
code复制PE(pos,2i) = sin(pos/10000^(2i/d_model))
PE(pos,2i+1) = cos(pos/10000^(2i/d_model))
这种编码方式既能表示绝对位置,也能通过线性变换表示相对位置关系。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Transformer完整架构解析
2.1 编码器-解码器结构
标准Transformer采用典型的编码器-
