1. 从规则到统计:NLP的蛮荒时代
上世纪50年代,当计算机科学家们第一次尝试让机器理解人类语言时,他们采用的方法简单直接——基于规则的系统。这种系统依赖于语言学家手工编写的语法规则和词典,比如著名的ELIZA聊天机器人(1966年)就是通过模式匹配和脚本响应来模拟心理治疗师的对话。
我在复现早期NLP系统时发现,规则方法的致命缺陷在于:英语中"Time flies like an arrow"这句话,用规则系统分析会产生多达5种语法解析结果,而人类凭常识能立即理解正确含义。
统计方法的兴起彻底改变了游戏规则。1990年代,IBM的Brown团队在机器翻译中引入统计模型,他们发现:当语料库足够大时,"the quick brown fox"这样的序列出现概率远高于"quick the fox brown"。这种基于概率的n-gram语言模型,使得机器第一次能够通过"猜"来生成合理的文本。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 神经网络的革命:从词向量到注意力机制
2013年,Mikolov提出的Word2Vec让NLP社区意识到:词语可以通过向量空间中的相对位置编码语义关系。我在实际应用中发现,"king - man + woman ≈ queen"这样的向量运算确实有效,但遇到"apple"既表示水果又表示公司时就会失效。
Transformer架构的出现在技术上实现了三个突破:
- 自注意力机制让模型可以动态关注不同位置的词语
- 位置编码替代了RNN的序列处理
- 并行计算使训练速度大幅提升
在BERT预训练实验中,我观察到模型确实学会了语言的一些深层规律。比如当遮盖句子"The ___ barked loudly"中的词时,模型会给"dog"分配比"cat"高得多的概率——因为它从海量文本中统计出了狗更常与"bark"搭配。
3. 大语言模型时代:能力与挑战并存
当GPT-3在2020年展现出惊人的few-shot学习能力时,我们团队立即测试了它的代码生成能力。实际使用中发现:虽然它能生成语法正确的Python代码,但需要非常精确的prompt工程才能得到可用结果。比如要求"用Python实现快速排序"时,有30%的概率会产生有逻辑错误的代码。
当前大模型面临的核心矛盾在于:
- 能力维度:在开放域对话中表现惊艳,但在专业领域(如法律、医疗
