1. 语言模型技术演进全景图
语言模型作为自然语言处理(NLP)的核心技术,其发展历程堪称人工智能领域的缩影。从最初的统计方法到如今的Transformer架构,每一次技术突破都深刻改变了我们与机器交互的方式。作为从业者,我亲历了从n-grams到BERT/GPT的技术迭代过程,今天将系统梳理这段演进历程中的关键技术节点。
现代语言模型的核心任务是预测文本序列的概率分布,即给定前文条件下预测下一个词的概率P(wₜ|w₁,...,wₜ₋₁)。这个看似简单的任务背后,蕴含着对语言规律的本质理解。早期的n-grams模型采用统计方法捕捉局部词频规律,而当今的Transformer架构则通过自注意力机制建模全局语义关联。
关键认知:语言模型的演进本质上是"上下文窗口"的扩展史——从n-grams的固定窗口到RNN的理论无限窗口,再到Transformer的真正全局窗口。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 统计语言模型的黄金时代
2.1 n-grams模型的数学本质
n-grams模型是统计语言模型的典型代表,其核心假设是马尔可夫性——当前词的概率仅依赖于前n-1个词。这种假设将语言建模问题转化为条件概率估计问题:
P(w₁,...,wₙ) ≈ ∏P(wᵢ|wᵢ₋ₙ₊₁,...,wᵢ₋₁)
在实际工程中,我们通常使用最大似然估计来计算这些条件概率。以bigram为例,其条件概率估计公式为:
P(wᵢ|wᵢ₋₁) = count(wᵢ₋₁,wᵢ) / count(wᵢ₋₁)
这种基于计数的简单方法在20世纪90年代到21世纪初主导了语音识别、机器翻译等NLP任务。我在早期语音识别项目中就曾大量使用trigram模型,其推理速度之快至今仍令人印象深刻。
2.2 平滑技术的艺术
数据稀疏性是n-grams模型面临的主要挑战。当语料库规模有限时,许多合理的词组合可能从未出现过,导致零概率问题。这促使了各种平滑技术的发展:
- 加一平滑(Laplace):最简单的平滑方法,为所有可能的n-gram计数加1
python复制def laplace_smoothing(count, total, vocab_size): return (count + 1) / (total + vocab_size)
