1. PageIndex与传统RAG的技术路线之争
最近AI圈被一个名为PageIndex的开源项目刷屏了。这个号称"基于推理的RAG"系统,在金融基准测试中取得了98.7%的惊人准确率,而且完全不需要传统的向量数据库、文档分块或相似性搜索。一时间,"RAG杀手"的称号不胫而走。作为一名长期关注检索增强生成(RAG)技术的从业者,我花了整整一周时间对PageIndex进行了深入测试,发现实际情况远比表面看到的要复杂。
1.1 PageIndex的核心创新
PageIndex由VectifyAI团队开发,其核心思路与传统RAG有本质区别。传统RAG的工作流程大家都很熟悉:文档分块→向量嵌入→相似性搜索→生成回答。而PageIndex采用了完全不同的技术路径:
- 层次树索引构建:将文档解析为树状结构,类似于语义化的目录体系
- LLM推理导航:利用大语言模型的推理能力在树结构中定位相关内容
- 精准内容提取:从确定的节点提取信息生成最终答案
这种设计的精妙之处在于:相似性搜索找到的是"相似"内容,而推理导航找到的是"相关"内容。举个例子,当询问"认证日期"时,传统RAG可能返回包含"认证"关键词的表格,而PageIndex能精准定位到文档中的时间线部分。
1.2 金融基准测试的惊人表现
VectifyAI发布的Mafin2.5系统(基于PageIndex)在FinanceBench上的表现确实令人印象深刻。98.7%的准确率远超传统RAG方案。但这里有个关键细节容易被忽视——FinanceBench测试的是单文档问答场景,每个问题都针对特定的财务报告。
这个细节后来被证明非常重要,因为当测试场景扩展到多文档时,PageIndex的表现出现了戏剧性变化。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 可扩展性测试与性能瓶颈
2.1 多文档场景的压力测试
为了验证PageIndex的真实能力,我使用Google的simpleqa-verified数据集(包含约1000个问题和2795个文档)进行了测试。结果发现:
- 索引构建问题:当文档数量超过5个时,树索引的构建时间呈指数级增长
- 内存消耗:处理100个文档就需要16GB以上内存
- 响应延迟:查询延迟在文档量增加时显著上升
最终,系
