1. 从传统RAG到Agentic RAG的技术演进全景
2019年首次提出的检索增强生成(Retrieval-Augmented Generation)技术,正在经历从1.0到2.0的范式跃迁。传统RAG像是个勤奋的图书管理员——根据问题查找相关资料,然后照本宣科地生成回答。而Agentic RAG则进化成了智库专家,不仅会检索,还能主动思考检索策略、动态评估信息质量、自主决策生成路径。
这个转变背后是三个关键突破:首先,大模型涌现的规划能力让系统可以自主拆解复杂问题;其次,工具使用(Tool Use)范式的成熟使得RAG系统能灵活调用外部API;最重要的是,反思(Reflection)机制的引入让系统具备持续优化的可能。在金融研报分析场景中,传统RAG可能直接返回检索到的财报片段,而Agentic RAG会先判断需要对比哪些指标,自动获取相关公司数据,最后生成带有趋势分析的完整报告。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 传统RAG的核心架构与典型痛点
2.1 经典三阶段工作流剖析
典型的传统RAG系统像条精密的流水线:
- 检索阶段:将用户查询编码为向量,通过FAISS等工具在向量数据库中进行近似最近邻搜索。这里的关键是查询扩展技术,比如用SPLADE模型生成扩展术语提升召回率。
- 上下文整合:将检索到的文档片段与原始查询拼接。实践中常用HyDE技术,先让LLM生成假设性回答,再用其向量作为检索依据。
- 生成阶段:配置系统提示词(如"请基于以下文档回答...")来约束LLM的输出范围。
2.2 实际部署中的七大致命伤
在帮某券商部署财报分析系统时,我们踩过这些坑:
- 检索精度塌陷:当用户问"苹果公司Q3营收"时,系统可能返回水果种植报告。解决方法是在嵌入模型中加入领域适配层。
- 上下文窗口浪费:检索返回的5个片段中可能只有2个相关。我们开发了基于交叉编码器的重排序模块,将相关度评分从0.72提升到0.89。
- 静态策略僵化:固定设置的top-k检索数量,在面对简单查询时造成计算浪费,复杂查询时又显不足。监控显示约有35%的请求存在资源错配。
关键发现:传统RAG的瓶颈不在于单个模块性能,而在于各环节间缺乏协同决策能力
