1. 项目概述:为什么需要一份AI大模型术语手册?
去年在调试一个多模态大模型时,我遇到了一个尴尬场景——团队讨论时有人提到"LoRA微调",我却误以为是某种新型优化器。这种基础概念的混淆不仅拖慢了项目进度,更暴露了知识体系的漏洞。这份手册正是为了解决这类问题而生,它整理了100个从基础到进阶的核心术语,涵盖模型架构、训练方法、部署应用等全流程。
不同于零散的百科词条,本手册特别注重概念之间的关联性。例如在解释"Transformer"时会自然引出"自注意力机制",说明"微调"时必然涉及"参数冻结"策略。这种网状知识结构能帮助读者建立系统认知,而非碎片化记忆。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心术语分类解析
2.1 基础架构类(20个关键概念)
-
Transformer架构:2017年革命性的模型结构,其核心是自注意力机制。不同于传统RNN的顺序处理,它能并行计算所有位置的关联权重。实际应用中,注意力的多头设计(通常8-16个头)让模型可以同时关注不同特征空间的信息。
-
Token与Embedding:文本被切分的最小单位(如"自然语言处理"可能被分成["自然","语言","处理"]),通过嵌入层转换为768/1024维的稠密向量。实践中需要注意不同模型的tokenizer差异——GPT系列基于BPE算法,而BERT使用WordPiece。
-
FFN层:Transformer中的全连接前馈网络,典型结构是输入维度->4倍扩展->输出维度。例如在LLaMA-2中,4096维的输入会先扩展到11008维再降维回去,这种"扩展-压缩"设计能增强模型表达能力。
关键技巧:理解架构概念时,建议同时关注其参数规模。比如"隐藏层维度"这个抽象概念,当你知道GPT-3达到12288维时,会对模型复杂度有更直观的感受。
2.2 训练优化类(30个核心方法)
-
预训练与微调:预训练是在海量通用数据(如Common Crawl)上的无监督学习,消耗约80%的计算资源;微调则用领域数据(如医疗记录)调整最后10%的参数。实际项目中,我们常用"渐进式解冻"策略——先微调最后几层,逐步解冻前面层。
-
LoRA(Low-Rank Adaptation):一种参数高效的微调技术。通过在原始权重旁添加低秩矩阵(秩r通常为4-64),只需调整0.1%的参数就能获得接近全参数微调的效果。公式表示为:W' = W + BA,其中B∈R^{d×r}, A∈R^{r×k}。
-
梯度检查点:显存优化技术,通过牺牲30%计算时间换取50%显存节省。原理是只保留部分层的激活值,其余层在反向传播时临时重新计算。在训练7B以上模型时,这个技术往往是必需品而非可选项。
表:常见训练技术对比
| 技术名称 | 显存占用 | 训练速度 | 适用场景 |
|---|---|---|---|
| 全参数微调 | 100% | 基准 | 数据充足时 |
| LoRA | 5-10% | 90% | 小样本适配 |
| QLoRA | 3-5% | 70% | 单卡微调大模型 |
| 梯度检查点 | 50% | 70% | 超大模型训练 |
2.3 部署应用类(25个实战要点)
-
量化部署:将FP32模型转换为INT8/INT4的技术。主流方案包括:
- 动态量化(推理时计算缩放因子)
- 静态量化(校准后固定缩放因子)
- GPTQ(基于二阶信息的逐层量化)
实测表明,合理量化可使7B模型在消费级显卡上流畅运行,精度损失控制在2%以内。
-
KV缓存:解码时的关键优化技术。将先前计算的Key-Value对缓存起来,避免重复计算。对于2048长度的序列,这能减少40%的计算量。但需要注意缓存会线性增长,需要设置合理的窗口大小。
-
推测解码:一种加速技术,先用小模型生成草稿,大模型并行验证。在合适场景下能提升2-3倍吞吐量。我们在客服机器人部署中,用350M模型做草稿生成,13B模型验证,实现了2.4倍加速。
3. 前沿技术深度解读
3.1 多模态大模型关键技术
-
视觉编码器:CLIP风格的ViT-L/14是当前主流选择,将图像分割为14×14的patch,通过对比学习与文本对齐。实际应用时需要注意:
- 分辨率影响:224px输入与336px输入的特征质量差异显著
- 计算代价:图像编码通常占多模态推理时间的60-70%
-
跨模态注意力:让文本token可以关注图像区域的关键机制。在实现上有两种方案:
- 早期融合(直接拼接图文token)
- 晚期融合(分别编码后通过交叉注意力交互)
实测表明后者更节省计算资源,适合实时应用。
3.2 分布式训练核心概念
-
ZeRO优化器:微软开发的显存优化技术,通过分片优化器状态(Stage1)、梯度(Stage2)、参数(Stage3)来实现。在训练13B模型时,ZeRO-3相比基础方案可减少80%的显存占用。
-
3D并行:
- 数据并行(拆分批次)
- 流水并行(拆分层)
- 张量并行(拆分矩阵运算)
在百亿级模型训练中,通常需要组合使用。例如GPT-3训练采用了8路流水并行+16路张量并行。
4. 实用速查指南
4.1 术语关系图谱
code复制基础架构
├── Transformer
│ ├── 自注意力
│ ├── FFN层
│ └── 层归一化
├── Tokenization
│ ├── BPE
│ └── WordPiece
└── 位置编码
├── 绝对位置
└── 相对位置
训练方法
├── 预训练
│ ├── MLM
│ └── NSP
├── 微调
│ ├── 全参数
│ └── 参数高效
└── 优化器
├── AdamW
└── 学习率调度
4.2 高频问题速查表
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
| 微调后模型输出乱码 | 学习率过高 | 尝试3e-5到5e-6的学习率 |
| 多轮对话记忆失效 | KV缓存长度不足 | 扩展至2048或4096 |
| 量化模型精度骤降 | 校准数据不足/不具代表性 | 使用500+代表性样本重新校准 |
| 训练loss震荡严重 | 梯度裁剪阈值设置不当 | 调整为1.0-2.0并监控梯度范数 |
5. 进阶学习路径建议
从实践角度看,建议按这个顺序深入:
- 先掌握前30个基础术语(架构+训练)
- 然后研究中间40个部署优化概念
- 最后攻克剩余30个前沿技术
对于急需应用的开发者,可以重点突破:
- 部署方向:量化、KV缓存、推测解码
- 微调方向:LoRA、QLoRA、DPO
- 推理优化:vLLM、TGI、FlashAttention
我在实际项目中最常查阅的仍然是基础概念——越是复杂的系统,越需要扎实的基础理论支撑。建议定期回顾"自注意力机制"、"梯度传播"等核心概念,每次都会有新的理解。
