1. 从ChatGPT到Agent:AI大模型的第一次进化
2022年底,ChatGPT的横空出世让全世界见识到了大语言模型(LLM)的强大能力。作为一个普通用户,你可能会惊叹于它流畅的对话能力、丰富的知识储备和惊人的文本生成质量。但很快你就会发现一个根本性限制——ChatGPT虽然能说会道,但它实际上什么都做不了。
1.1 大语言模型的本质局限
大语言模型本质上是一个"知识蒸馏器",它通过海量数据训练获得了对语言的深刻理解,能够预测最可能的文本序列。但这种能力存在三个关键局限:
- 缺乏实时信息:模型的知识截止于训练数据的时间点
- 无法执行操作:不能调用API、访问数据库或操作系统
- 纯文本交互:输入输出都局限于文本形式
这就好比雇佣了一位博学的顾问(大M),他虽然上知天文下知地理,但既不能帮你查实时股票行情,也不能帮你预订会议室。
1.2 Agent架构的诞生
为了解决这个问题,工程师们设计出了Agent架构。一个完整的Agent包含以下核心组件:
code复制Agent = 大语言模型(大M) + 提示词工程 + 工具调用程序 + 工具清单 + 具体工具
- 大M:负责理解用户意图、规划任务流程
- 提示词工程:指导大M如何选择和使用工具
- 工具调用程序:将大M的指令转化为具体工具调用
- 工具清单:记录所有可用工具及其功能描述
- 具体工具:实现特定功能的代码模块
这种架构让AI从"能说"进化到了"能做"。例如,当用户说"帮我看看今天的大盘走势"时:
- 大M理解这是股票查询需求
- 从工具清单中定位到"股票数据查询工具"
- 生成工具调用指令
- 工具调用程序执行实际查询
- 将结果返回给大M进行总结
- 最终呈现给用户
提示:在实际开发中,工具清单通常采用JSON格式,包含工具名称、描述、参数定义等信息。这是确保大M能准确选择工具的关键。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Function Calling:Agent内部的关键协议
2.1 自然语言与结构化数据的鸿沟
在早期Agent实现中,工程师们很快发现一个严重问题:大M输出的自然语言指令(如"调用股票查询工具获取今日数据")无法被工具调用程序直接理解。这就像两个说不同
