1. 开源大模型架构演进与技术解析
1.1 主流大模型架构对比
1.1.1 Encoder-only架构(BERT为代表)
BERT采用双向Transformer编码器结构,其核心特点是:
- 全视野注意力机制:每个token都能看到序列中所有其他token
- 预训练任务创新:
- Masked Language Model(MLM):随机遮盖15%的token,其中80%替换为[MASK],10%替换为随机词,10%保持不变
- Next Sentence Prediction(NSP):判断两个句子是否连续
典型应用场景:
python复制# 情感分析示例
from transformers import BertTokenizer, BertForSequenceClassification
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
model = BertForSequenceClassification.from_pretrained('bert-base-uncased')
inputs = tokenizer("今天的天气很[MASK],适合出去玩", return_tensors="pt")
outputs = model(**inputs)
1.1.2 Decoder-only架构(GPT为代表)
GPT系列采用单向Transformer解码器结构:
- 自回归生成:通过三角掩码限制只能看到当前及之前的token
- 训练一致性:预训练(预测下一个词)与推理过程完全一致
生成示例流程:
- 输入:"今天的天气很"
- 输出:"今天的天气很暖和,适合出去玩"
1.1.3 Encoder-Decoder架构(T5为代表)
典型代表是T5模型,其特点包括:
- 双向编码+单向解码:Encoder处理输入时能看到全文,Decoder生成时只能看到已生成内容
- 统一文本到文本格式:将所有NLP任务转化为text-to-text形式
1.2 注意力机制技术演进
1.2.1 标准注意力机制对比
特性 |
