1. 大模型技术栈的核心三支柱
在大模型技术架构中,Tokenizer、Embedding和Transformer构成了不可分割的黄金三角。这三个组件协同工作,完成了从原始文本到智能输出的完整处理链条。理解它们各自的作用原理和交互方式,是掌握大模型底层逻辑的关键。
1.1 Tokenizer:文本与数字世界的翻译官
Tokenizer作为整个处理流程的第一道关卡,承担着将人类可读文本转化为机器可处理数字的关键任务。现代大模型主要采用以下两种分词策略:
-
子词切分(Subword Tokenization):通过BPE(Byte Pair Encoding)等算法,将单词拆分为更小的语义单元。例如"unhappiness"可能被分解为["un", "happi", "ness"]三个token。这种方案完美平衡了词典大小与语义表达力,典型实现包括:
- GPT系列的BPE分词器(词典大小约5万)
- BERT的WordPiece分词器(中文按字切分)
- T5的SentencePiece分词器(支持多语言混合)
-
混合切分策略:针对中文等非空格分隔语言,常用字符级与词级结合的切分方式。例如"自然语言处理"可能被切分为["自然", "语言", "处理"]三个token,而英文短语则保持单词完整。
实际经验:处理中文文本时,建议测试不同分词器效果。我们曾遇到专业术语"残差连接"被错误切分为["残", "差", "连", "接"]导致模型性能下降的案例,最终通过自定义词典解决。
1.2 Embedding:语义空间的坐标映射
经过Tokenizer处理的数字ID需要转化为具有语义信息的稠密向量,这就是Embedding层的核心使命。现代大模型的Embedding实现有几个关键演进:
- 静态Embedding:早期Word2Vec生成的固定向量,无法处理一词多义
- 动态Embedding:Transformer中的Embedding层会随模型训练调整,典型特点包括:
- 维度通常为1024/2048/4096等2的幂次方
- 包含可学习的position embedding处理序列顺序
- 高级模型会加入token type embedding区分不同文本片段
一个典
