1. RAG文档切分的核心挑战与现状
在构建检索增强生成(RAG)系统时,大多数开发者都会把注意力集中在检索器和生成模型的选择上,却往往忽视了一个关键环节——文档切分(chunking)。这个看似简单的预处理步骤,实际上直接影响着最终系统的性能上限。就像盖房子时只顾挑选高档建材,却忽略了地基的稳固性一样危险。
当前主流的RAG评测基准(如HotpotQA、Natural Questions)存在一个严重缺陷:它们只关注端到端的问答准确率,却无法反映文档切分的质量。这就导致了一个诡异现象——当答案证据集中在一个段落时(我们称为"证据稀疏"场景),无论你用简单的按字数切分还是复杂的语义切分,最终指标可能相差无几。但一旦遇到需要跨段落组合信息的"证据稠密"场景,劣质切分就会暴露出证据断裂、信息丢失等问题。
腾讯优图实验室的最新研究揭示了这一问题的严重性。他们发现,在传统评测集上表现相近的两种切分方法,当面对需要组合多个段落信息的复杂问题时,准确率差距可能高达40%。这就像用两种不同的刀法切牛排——表面看都是小块牛肉,但一种保留了完整的肌肉纹理(便于咀嚼),另一种却切断了纤维(难以下咽)。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. HiCBench:首个文档切分质量专用评测基准
2.1 基准设计理念
HiCBench的诞生直指行业痛点——现有的RAG评估就像只检测汽车的最高时速,却不管它的悬挂系统和转向性能。这个基准包含三大创新设计:
-
多级切分点标注:由专业标注团队在130篇长文档(平均8500词)中标记了1200处语义边界,就像给文章划出了天然的"关节位置"。这些标注覆盖从段落级到章节级的不同粒度。
-
证据稠密QA对:精心设计的1200个问题中,59%需要组合同一语义块内多个句子(T1任务),41%需要跨多个语义块(T2任务)。每个问题的平均证据跨度超过20个句子,远超传统数据集的3-5句。
-
动态难度调控:通过控制证据分布的离散程度(从集中到分散)和干扰信息的比例,模拟真实场景中的各种挑战。
2.2 评测任务类型解析
| 任务类型 | 证据特征 | 考核重点 | 示例问题 |
|---------
