1. 解码器专用Transformer架构的核心逻辑
在当今生成式AI领域,LLaMA、Mistral和GPT等主流大模型都采用了Decoder-only Transformer架构。这种架构之所以成为行业标准,是因为它完美适配了自回归文本生成的特性需求。让我们从数学本质出发,拆解这个架构的运作机制。
1.1 输入数据的矩阵化表示
计算机处理自然语言的第一步,是将离散的符号转化为连续的数值表示。这个过程涉及两个关键步骤:
词嵌入(Word Embedding) 将每个token映射到高维空间中的一个点。假设我们有一个包含5万个单词的词表,通过嵌入层后,每个单词会被表示为d_model维的向量(如LLaMA-7B中d_model=4096)。数学上,这相当于一个巨大的查找表操作:
code复制E = lookup(token_id) # E ∈ R^{d_model}
位置编码(Positional Encoding) 则解决了Transformer架构与生俱来的一个缺陷:普通的矩阵运算不具备序列顺序感知能力。通过将位置信息编码为与词嵌入同维度的向量,并与词向量相加:
code复制PE = positional_encoding(position) # PE ∈ R^{d_model}
X = E + PE # X ∈ R^{d_model}
实际实现中,位置编码通常采用正弦余弦函数的组合,这种设计使得模型能够学习到相对位置关系,且可以处理比训练时更长的序列。
1.2 注意力机制的三元组:QKV
Transformer的核心创新在于其注意力机制,而理解注意力机制的关键在于把握QKV(Query-Key-Value)三元组的本质:
- 查询(Query): 表示当前token想要获取的信息特征
- 键(Key): 表示每个token能够提供的信息特征
- 值(Value): 表示每个token实际包含的内容信息
这三个矩阵通过线性变换从同一输入产生:
code复制Q = X @ W_Q # W_Q ∈ R^{d_model×d_k}
K = X @ W_K # W_K ∈ R^{d_model×d_k}
V = X @ W_V # W_V ∈ R^{d_model
