1. 项目概述:SimpleQA Verified 的诞生背景与核心价值
在2024年的大语言模型(LLM)应用浪潮中,一个令人尴尬的现象越来越频繁地出现:模型能够流畅地生成看似专业的回答,却在基础事实上频频出错。这种现象被业界称为"幻觉"(hallucination),就像一位口若悬河的专家,却在关键时刻说错关键数据。医疗领域曾发生过一起典型案例:某医疗问答模型将"成年人正常体温范围"错误地回答为"34.5-35.8°C",而实际应为36.5-37.5°C——这种错误在真实场景中可能造成严重后果。
OpenAI在2024年底推出的SimpleQA基准试图解决这一问题,它通过约4000个短问答对来测试模型的事实召回能力。但很快,研究者们发现了三个致命问题:首先,约8%的问题标签存在错误,比如将"特斯拉创立年份"标注为2004年(实际为2003年);其次,问题主题严重失衡,科技类占比高达42%,而历史、艺术等领域不足10%;最后,存在大量重复问题变体,如"Java诞生年份"和"Java语言发布时间"这类语义几乎相同的问题。
Google DeepMind团队在2025年初的一项实验中发现,当使用SimpleQA评估时,模型性能的"提升"有近30%实际上来自于对基准缺陷的过拟合,而非真正的知识能力进步。这促使他们联合Google Research启动了SimpleQA Verified项目——一套经过九层严格筛选的千题基准,其核心创新在于:
- 源数据可信度验证:每个问题必须有两个独立权威来源交叉验证
- 主题平衡算法:确保各领域问题占比符合真实知识分布
- 双重去重机制:结合语义相似度和词汇重叠度剔除冗余
- 动态评分器:能识别模型"绕开问题实质"的取巧回答
实测数据显示,当使用SimpleQA Verified评估时,顶级模型间的性能差距被明显放大:Gemini 2.5 Pro以55.6%的F1-Score领先,而GPT-5仅为49.2%。这种区分度在原始基准中是完全无法观察到的,充分证明了新基准的鉴别能力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基准构建的技术深潜:从原始数据到黄金标准
2.1 数据清洗流水线设计
SimpleQA Verified的构建过程犹如精密的钟表制造,每个处理阶段都有明确的输入、处理和输出标准。
