1. 大语言模型(LLM)的本质:预测下一个词
很多人第一次接触ChatGPT这类大语言模型时,都会产生一个误解:这玩意儿是不是把整个互联网的内容都背下来了?就像个超级搜索引擎,你问什么它就去数据库里查什么。但实际情况完全不是这样。
大模型的核心工作其实非常简单——预测下一个词。当你输入"今天天气"时,它不是在数据库里查找关于天气的答案,而是在计算"真"、"好"、"不"、"错"这些词出现的概率。这和你手机输入法的联想功能原理相同,只不过大模型的能力要强大得多。
关键区别:搜索引擎是检索已有信息,大模型是生成新的内容。前者像查字典,后者像写作文。
这种预测能力来自对海量文本数据的学习。模型通过分析数万亿个词语的搭配关系,掌握了人类语言的统计规律。比如它知道"北京"和"首都"经常一起出现,"猫"和"狗"都属于动物类别。这些关联关系都以数学权重的形式存储在模型的参数中。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 从文字到数字:模型如何"理解"人类语言
2.1 分词与向量化
模型其实看不懂中文或英文,它只认识数字。所以处理文本的第一步是将文字转化为数字表示,这个过程分为两个关键步骤:
-
分词(Tokenization):将句子拆分为有意义的单元。例如"我爱AI"可能被分为["我","爱","AI"]三个token。中文分词比英文复杂,因为中文没有明显的单词分隔。
-
向量化(Embedding):每个token被映射为一个高维向量(通常是几百到几千维)。比如:
- "猫" → [0.12, -0.45, 0.78, ...]
- "狗" → [0.15, -0.42, 0.81, ...]
- "汽车" → [-0.56, 0.23, -0.11, ...]
这些数字不是随机的,语义相近的词在向量空间中的位置也很接近。通过数学计算,模型能知道"开心"和"高兴"意思相似,而它们与"悲伤"的距离较远。
2.2 上下文理解的关键:注意力机制
2017年Google提出的Transformer架构彻底改变了自然语言处理领域。其核心创新是注意力机制(Attention Mechanism),它解决了传统模型的两个致命缺陷:
- 长距离依赖问题:在句子"虽然昨天天气不好,但我们还是决定去野餐,结果很..."
