1. 大语言模型基础架构全解析
在人工智能领域,大语言模型(LLM)已经成为改变游戏规则的技术。但很多从业者在使用过程中,常常对LLM相关概念存在模糊认知。本文将系统性地拆解LLM技术栈的10个核心概念,帮助开发者构建完整的知识框架。
1.1 LLM的本质与局限
大语言模型(Large Language Model)本质上是一个基于概率的文本生成器。它的核心工作原理是:根据输入的文本序列,预测下一个最可能出现的token(词元)。这种预测能力来源于对海量文本数据的训练,使模型能够捕捉语言中的统计规律。
但必须明确的是,纯LLM存在三个根本性限制:
- 无实时信息获取能力:模型权重固化后,无法主动获取训练数据之外的新信息
- 无自主执行能力:只能输出文本,无法直接操作外部系统或执行具体任务
- 无持续记忆:每次推理都是独立事件,无法真正"记住"历史交互
理解这些限制非常重要,因为后续的Tool、Agent等概念都是为了突破这些限制而设计的解决方案。
1.2 Token化机制详解
Token是LLM处理文本的基本单位,不同于简单的字符或单词。以GPT系列模型为例:
- 英文单词通常被切分为1个token(如"apple")或子词(如"unhappiness"→"un", "happiness")
- 中文汉字通常1-2个字符对应1个token(取决于分词结果)
- 特殊符号和空格也会被token化
这种设计带来两个关键影响:
- 计算效率:相比逐字符处理,token化能减少序列长度
- 语义保留:子词切分有助于模型理解词根和词缀关系
实际应用中,开发者需要特别关注:
不同模型的tokenizer实现差异很大,同样的文本在不同模型中可能产生不同数量的token。例如,Claude和GPT对中文的token化效率就有显著区别。
1.3 上下文窗口的工程实践
Context Window(上下文窗口)定义了模型单次处理的最大token数量。这个参数直接影响:
- 长文档处理能力:超过窗口限制的内容会被直接截断
- 多轮对话记忆:历史对话轮次越多,消耗的context越多
- 计算资源消耗:context长度与计算成本呈平方关系(由于注意力
