1. 大语言模型(LLM)的本质与约束
大语言模型本质上是一个基于概率预测的文字接龙机器。当输入一段文本时,它会预测下一个最可能出现的词,然后用预测出的词继续预测下一个词,如此循环往复。这个看似简单的机制带来了三个关键的产品约束:
-
概率计算而非思考:LLM不进行逻辑推理,而是基于训练数据中的统计规律进行概率计算。在需要严密逻辑的场景(如数学证明、法律条文解释)中,错误率会显著升高。
-
知识时效性限制:模型的知识截止于训练数据的时间点。例如,GPT-4的知识截止到2023年,询问2024年的事件它会"编造"答案。
-
输出不确定性:模型会在多个高概率候选词中随机选择,导致相同输入可能产生不同输出。通过调整temperature参数可以控制这种随机性。
实际项目经验:在设计客服系统时,我们为涉及退款金额、政策条款等关键信息的查询设置了规则引擎兜底,当模型输出与知识库不一致时自动触发人工审核。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 提示词(Prompt)工程四要素
优质的提示词需要包含四个关键要素,缺一不可:
2.1 角色设定
明确模型需要扮演的角色。对比以下两种写法:
- 差:"你是个客服"
- 好:"你是XX电商平台的在线客服专员,负责处理订单查询和售后服务,使用礼貌用语和统一的话术风格"
2.2 任务描述
具体说明需要完成的工作。例如:
"请根据用户提供的订单号,查询物流状态并告知预计送达时间。如果订单异常,按照以下流程处理:1.道歉 2.说明原因 3.提供解决方案选项"
2.3 输出约束
规定回答的格式和长度:
- "用JSON格式输出,包含tracking_number、status、estimated_delivery三个字段"
- "回答限制在100字以内"
2.4 上下文信息
提供必要的背景资料:
"参考知识:我司物流时效标准:同城24小时,省内48小时,跨省72小时。超过时效可申请10元优惠券补偿。"
3. Token计费机制详解
3.1 中英文Token差异
- 英文:1个单词≈1-1.5个Token
- 中文:1个汉字≈1.5-2个Token
- 标点符号:每个≈1个Token
3.2 成本计算公式
code复制总成本 = 输入Token数×输入单价 + 输出Token数×输出单价
以GPT-4-32k为例:
- 输入:$0.06/1K tokens
- 输出:$0.12/1K tokens
3.3 典型场景成本估算
| 场景 | 输入Token | 输出Token | 单次成本 | 10万次/月成本 |
|---|---|---|---|---|
| 简短问答 | 500 | 200 | $0.048 | $4,800 |
| 文档摘要 | 8000 | 1000 | $0.60 | $60,000 |
| 长文生成 | 2000 | 3000 | $0.42 | $42,000 |
优化建议:对于高频调用的System Prompt,通过精简措辞、使用缩写等方式将Token控制在1000以内,可显著降低长期成本。
