1. SimpleQA基准:为什么我们需要专门评估大模型的短文本事实性?
在2023年ChatGPT引爆全球AI热潮后,大语言模型(LLM)的"幻觉"问题逐渐成为制约其商业落地的最大瓶颈。作为长期从事AI产品落地的工程师,我见过太多这样的场景:医疗咨询机器人信誓旦旦地推荐错误药物,法律助手对不存在的判例引经据典,客服系统编造根本不存在的促销政策...这些问题的本质,是模型无法准确判断自己知识的边界。
OpenAI的研究团队在《Measuring short-form factuality in large language models》论文中提出了一个精妙的解决方案——SimpleQA基准。这个包含4,326个问题的测试集,每个都满足三个关键特征:
- 问题明确指向单一正确答案(如"特斯拉公司成立于哪一年?")
- 答案有可验证的公开证据支持
- 答案不会随时间改变
我在实际项目中使用这个基准时发现,它特别适合解决两类典型问题:
- 过度自信型错误:模型对不知道的问题也强行作答
- 保守回避型错误:模型对知道答案的问题也拒绝回答
实践建议:在部署金融、医疗等高风险领域应用前,建议先用SimpleQA测试模型的"自知之明"水平。我们团队的经验是,当correct-given-attempted低于70%时,必须引入人工审核流程。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. SimpleQA数据集构建:人工+AI的黄金标准
2.1 数据收集的双重验证机制
SimpleQA的数据收集流程让我联想到制药行业的GMP标准。其核心是"双重人工验证+AI质检"的流水线:
-
第一轮创作:专业标注员(AI trainer)提出问题时,必须同时提供至少两个独立来源的网页证据。例如问"《蒙娜丽莎》的创作年份",需附上卢浮宫官网和大英百科的链接。
-
第二轮验证:另一名标注员在不知晓原答案的情况下,独立查找证据并回答问题。只有双方答案一致的问题才会保留。
我们在复现这个流程时发现,这种设计有效过滤了约28%的模糊问题。一个典型案例是原本的问题"谁发明了电话",在验证阶段发现存在贝尔和梅乌奇的历史争议,因此被剔除。
2.2 对抗性筛选的独特价值
与传统QA数据集不同,SimpleQA专门针对GPT-4进行了对抗性增强:
- 标注
