1. 大模型(LLM)领域常用名词全解:0基础入门篇
刚接触大语言模型时,最头疼的就是各种专业术语——从Transformer到LoRA,从RLHF到RAG,每个词背后都代表着一整套技术栈。作为从BERT时代就开始折腾语言模型的老兵,我整理了这份"生存指南",帮你快速掌握28个核心概念。这些知识都是我过去三年在工业级项目里实打实踩坑总结出来的,不同于教科书的理论解释,我会用最直白的语言告诉你每个术语到底怎么用、为什么重要、以及新手最容易误解的地方。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基础概念(必懂核心)
2.1 大语言模型(LLM)的本质
LLM不是魔法黑箱,本质上是一个超大规模的"下一个词预测器"。以GPT-3为例,它的1750亿参数本质上是在学习"给定上文时,下一个词的概率分布"。但神奇的是,当模型规模超过某个临界点(约60亿参数),突然就能涌现出理解、推理、创作等复杂能力。
关键认知:大模型的"大"不仅指参数量,更关键的是涌现能力(Emergent Abilities)。就像水到100℃会沸腾,模型超过临界规模后会产生质变。
实际项目中,选择模型尺寸要考虑:
- 7B参数模型:适合本地部署(如MacBook Pro M2可跑)
- 13B-70B:企业级服务常用区间
- 175B+:仅限大厂玩得起
2.2 Token化:模型的"语言密码本"
当你说"你好"时,模型看到的可能是["你", "好"]两个token ID。英文更复杂,"ChatGPT"可能被拆成["Chat", "G", "PT"]。这直接影响到:
- 计算成本:API按token收费
- 处理效率:长文本拆分影响速度
- 上下文限制:比如32k tokens≈2.5万汉字
实测发现,中文平均1字=1.3 tokens(因为标点、数字等单独编码),而英文1单词≈1.5 tokens。建议用tiktoken库精确计算:
python复制import tiktoken
enc = tiktoken.encoding_for_model("gpt-4")
print(len(enc.encode("你好,世界!"))) # 输出6
2.3 Transformer架构的精髓
2017年Google提出的Transformer是LLM的基石,其核心是自注意力机制
