1. Token:AI 语言处理的基本单位
很多人以为AI像人类一样认识字母和单词,其实完全不是这样。AI处理文本的最小单位叫做token,你可以把它理解为"文本碎片"。这个概念之所以重要,是因为它直接关系到AI如何理解和生成语言。
1.1 Token的构成原理
Token的划分方式因模型而异,但通常遵循以下规则:
- 常见单词可能作为一个完整token(如"cat")
- 前缀/后缀可能单独成token(如"un-"、"-tion")
- 标点符号通常是独立token
- 中文通常以字或词为单位划分token
举个例子:"I love pizza"这句话:
- 在GPT模型中可能被分成3个token:["I", " love", " pizza"]
- 而"unhappiness"可能被分成3个token:["un", "happiness"]
1.2 Token的实际影响
理解token对使用AI有直接帮助:
- 成本计算:大多数AI服务按token收费,包括输入和输出
- 上下文限制:模型的记忆能力由最大token数决定
- 提示工程:知道如何拆分token能写出更高效的提示词
提示:英文中空格通常计入前一个token,所以" love"前面有空格,而"I"后面没有
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Context Window:AI的记忆边界
Context Window(上下文窗口)决定了AI能同时处理多少信息。这就像给AI一块白板,它能在这块白板上写字、阅读,但一旦写满,就必须擦掉前面的内容才能继续。
2.1 窗口大小的演进
模型发展史就是context window的扩张史:
- GPT-3初期:2048 tokens(约1500单词)
- GPT-3.5:4096 tokens
- Claude 2:100k tokens
- Gemini 1.5:最高支持1M tokens
2.2 窗口大小的实际意义
更大的窗口意味着:
- 能处理更长文档(整本书vs几页纸)
- 维持更长对话而不"失忆"
- 处理复杂任务时能保留更多上下文
常见误区:很多人以为AI会"学习"或"记住"之前的对话。实际上,每次交互都是独立的,模型只是把之前的对话历史作为新的输入。
3. Harness:AI的工程框架
Harness是包裹AI模型的工程系统,它决定了模型能做什么、怎么做。如果把AI模型比作大脑,Harness就是身体和工具。
3.1 Harness的核心组件
| 组件 | 功能 | 实际案例 |
|---|---|---|
| 执行环境 | 安全运行AI生成的代码 | GitHub Copilot的沙箱环境 |
| 工具集成 | 连接外部API和服务 | ChatGPT的联网搜索功能 |
| 记忆管理 | 处理长期记忆和短期记忆 | Notion AI的项目上下文记忆 |
| 任务编排 | 分解和调度复杂任务 | AutoGPT的任务分解能力 |
3.2 为什么Harness比模型更重要
随着基础模型趋同,产品差异主要体现在:
- 安全性:如何防止有害代码执行
- 效率:如何优化资源使用
- 用户体验:如何简化复杂能力
- 扩展性:如何集成其他工具
开发启示:构建AI应用时,应该用70%精力设计Harness,30%选择模型。
4. Temperature:创造力的调节旋钮
Temperature参数控制AI输出的随机性,是影响生成质量的关键因素。
4.1 参数效果对比
| Temperature值 | 输出特点 | 适用场景 |
|---|---|---|
| 0-0.3 | 保守、可预测 | 代码生成、事实回答 |
| 0.3-0.7 | 平衡 | 一般对话、内容创作 |
| 0.7-1.0 | 创意性强 | 头脑风暴、诗歌写作 |
| >1.0 | 随机性极高 | 实验性创作 |
4.2 实操建议
- 调试方法:从0.3开始,逐步上调直到获得理想结果
- 组合使用:可以首先生成多个高temperature结果,然后筛选最佳
- 领域差异:
- 技术写作:0.2-0.5
- 营销文案:0.5-0.8
- 创意写作:0.7-1.2
常见错误:在需要准确性的场景使用高temperature,导致事实错误。
5. Hallucination:AI的虚构问题
Hallucination(幻觉)指AI自信地生成不准确或虚构内容的现象。理解其成因和应对方法至关重要。
5.1 产生原因深度分析
- 训练目标:模型被训练来生成"合理"而非"真实"的内容
- 知识局限:训练数据截止后的事件完全不了解
- 提示诱导:模糊或矛盾的提示易导致幻觉
- 过度自信:模型没有"不确定"的表达方式
5.2 实用应对策略
-
提示技巧:
- "如果你不确定,请说明"
- "仅基于可靠来源回答"
- "分步骤思考并验证"
-
技术方案:
- 结合检索增强(RAG)
- 使用多个模型交叉验证
- 添加事实核查步骤
-
用户策略:
- 关键信息二次确认
- 检查时间敏感性
- 留意过于绝对的表述
6. RAG:让AI"学习"新知识
Retrieval-Augmented Generation(检索增强生成)是让AI处理新知识的主流方法。
6.1 技术实现详解
-
文档处理:
- 文本分块(通常256-1024 tokens)
- 向量化(使用embedding模型)
- 存储到向量数据库
-
查询时:
- 将问题转换为向量
- 检索最相关的文档块
- 将文档块作为上下文提供给模型
-
生成阶段:
- 模型基于检索内容和问题生成回答
- 可添加引用标注
6.2 优化技巧
-
分块策略:
- 重叠分块(相邻块有部分重叠)
- 语义分块(按主题而非固定长度)
-
检索优化:
- 混合检索(结合关键词和语义)
- 重排序(对初步结果再排序)
-
提示工程:
- "基于以下上下文回答..."
- "如果信息不足,请说明..."
7. Agent:AI的自主形态
AI Agent代表人工智能从工具向助手的进化,能够自主完成复杂任务。
7.1 Agent的核心能力
-
规划能力:
- 目标分解
- 任务排序
- 资源分配
-
工具使用:
- API调用
- 代码执行
- 外部服务集成
-
记忆机制:
- 短期记忆(当前任务)
- 长期记忆(知识库)
- 情景记忆(过往经验)
7.2 构建Agent的实践要点
-
明确边界:
- 确定自主决策范围
- 设置人工审核节点
-
安全设计:
- 操作确认机制
- 回滚能力
- 权限控制
-
评估指标:
- 任务完成率
- 人工干预频率
- 错误率
开发建议:从简单、明确的场景开始,逐步增加复杂性,每个阶段都要有完善的测试和监控。
