1. 垂直Agent落地中的稳定性挑战与解决思路
在垂直领域Agent的实际落地过程中,我们团队遇到了一个出乎意料的核心问题:不是模型不够聪明,而是行为不够稳定。这个问题在复杂业务场景中尤为突出,直接影响了系统的可用性和可靠性。
1.1 典型不稳定现象分析
在多轮对话和复杂上下文(包括RAG检索、多工具返回、多步骤流程)场景下,我们观察到大模型主要存在三类稳定性问题:
-
工具调用决策不稳定:模型在该调用工具时选择不调用,导致关键业务逻辑缺失。例如在网络安全分析场景中,模型可能跳过关键的URI信誉查询步骤,直接给出分析结论。
-
调用参数准确性不足:虽然决定调用工具,但函数名或参数经常出错。常见问题包括:
- 函数名拼写错误或调用不存在的API
- 参数类型不匹配(如字符串传数字)
- 必填字段缺失或枚举值超出范围
-
结果解析一致性差:对工具返回结果的解读随上下文变化而波动,同一输入在不同轮次可能得到完全不同的处理结论。这种"解读漂移"现象在结构化数据处理时尤为致命。
1.2 传统优化方案的局限性
最初,我们尝试通过以下方式改善稳定性:
- 升级更大规模的基座模型:从Qwen3-8B逐步测试到235B甚至671B参数版本
- 加强Prompt Engineering:通过更精细的指令设计和上下文管理引导模型行为
- 完善流程编排:增加重试机制、结果校验等容错逻辑
但实践发现这些方法存在明显瓶颈:
- 模型规模增大带来的稳定性提升呈现边际递减效应
- 长上下文导致的注意力漂移难以通过Prompt完全控制
- 复杂的流程编排使系统变得脆弱,故障模式更加不可预测
关键发现:在垂直领域,单纯依赖模型规模和Prompt工程无法从根本上解决行为稳定性问题。需要将领域知识和工具调用契约"固化"到模型参数中。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 小模型优化方案设计与实现
基于上述认知,我们转向新的技术路线:使用中等规模模型(Qwen3-8B)通过后训练专门优化垂直领域的行为稳定性。
2.1 技术方案架构
整个优化流程分为两个关键阶段:
- 监督微调(SFT)阶段:
- 目标:注入领域专业知识,使模型理解业务场景和数据处理逻辑
- 数据准备:
