1. 从文本处理到Transformer的演进之路
计算机处理文本的挑战远比处理图像更为复杂。当我们面对一张图片时,计算机可以将其分解为像素矩阵,通过空间关系理解内容。但文本信息天然具有时序性,词语的顺序和上下文关系直接决定了语义表达。比如"猫追老鼠"和"老鼠追猫"这两个句子,虽然用词完全相同,但表达的意思却截然相反。
在自然语言处理(NLP)的发展历程中,研究者们尝试了多种方法来让计算机理解文本。早期的词袋模型(Bag of Words)完全忽略了词语顺序,显然无法满足需求。随后出现的n-gram模型虽然考虑了局部词序,但仍然缺乏对长距离依赖的建模能力。直到神经网络的出现,才真正开启了文本理解的深度学习时代。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. RNN与LSTM:序列建模的早期探索
2.1 RNN的基本原理
循环神经网络(RNN)是第一个成功应用于序列建模的神经网络架构。它的核心思想是通过隐藏状态(hidden state)来保存历史信息。在处理文本时,RNN会逐个词语进行处理,并将当前词语的信息与之前所有词语的隐藏状态结合起来。
数学上,RNN的计算过程可以表示为:
code复制h_t = f(W * x_t + U * h_{t-1} + b)
其中h_t是当前时刻的隐藏状态,x_t是当前输入,W和U是权重矩阵,b是偏置项,f是非线性激活函数(通常为tanh或ReLU)。
2.2 RNN的局限性
尽管RNN在理论上可以处理任意长度的序列,但在实际应用中存在几个严重问题:
-
梯度消失/爆炸问题:在反向传播过程中,梯度需要通过时间步连续相乘。当序列较长时,梯度可能会指数级衰减或增长,导致模型难以训练。
-
长距离依赖问题:由于梯度消失,RNN难以学习相隔较远的词语之间的关系。例如在句子"那只我昨天在公园看到的黑白相间的猫..."中,最后的"猫"需要与开头的"那只"建立联系,这对RNN来说非常困难。
-
并行化困难:RNN必须按顺序处理输入,无法充分利用现代GPU的并行计算能力。
2.3 LSTM的改进
长短期记忆网络(LSTM)通过引入门控机制解决了RNN的部分问题。LSTM的核心是三个门:遗忘门、输入门和输出门,它们共同控制信息的流动:
code复制遗忘门:f_t = σ(W_f * [h_{t-
