1. HLE-Verified榜单发布背景与意义
当前大语言模型在复杂推理任务上的竞争已进入白热化阶段,各大科技公司纷纷推出迭代版本,宣称在各项基准测试中取得突破性进展。然而一个长期被忽视的核心问题是:我们用来衡量模型能力的评测基准本身是否足够可靠?
这个问题在Humanity's Last Exam(HLE)这类高难度推理基准上表现得尤为突出。HLE作为包含2,500道跨学科难题的测试集,原本设计用于评估模型在接近人类极限认知水平任务上的表现。但在实际使用中,研究者们逐渐发现:
- 约30%的题目存在题干表述模糊、参考答案错误或解题逻辑缺陷
- 不同模型对同一问题的错误模式呈现高度相关性
- 某些模型的"能力提升"可能仅仅是因为更擅长识别并规避有缺陷的题目
这种情况导致了一个严峻的悖论:当评测基准本身的质量存疑时,基于该基准得出的模型能力排名还有多少参考价值?HLE-Verified项目正是为解决这一根本性问题而生。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. HLE-Verified基准构建方法论
2.1 系统化验证流程设计
HLE-Verified采用两阶段"验证-修复"工作流,每个阶段都包含严格的质控环节:
第一阶段:原始数据诊断
- 组建跨学科专家团队(数学、物理、计算机科学等7个领域)
- 开发标准化验证工具包,包括:
- 题干语义解析模板
- 解题过程逻辑验证流程图
- 答案一致性检查表
- 实施双盲评审机制,要求每位专家独立标注问题缺陷
第二阶段:保守性修订
- 对确认存在缺陷的题目,提供三种处理路径:
- 语义明确的直接修正(Revision子集)
- 争议较大的标记为Uncertain
- 确认无误的纳入Gold子集
- 建立修订追溯系统,记录每个修改决策的完整依据
关键原则:宁可保留有疑问的原始题目(Uncertain子集),也不引入未经充分验证的修订内容。这种保守策略最大程度避免了新偏差的引入。
2.2 细粒度缺陷分类体系
与传统二分类(正确/错误)不同,HLE-Verified建立了19维缺陷分类系统:
| 缺陷层级 | 主要类别 | 典型示例 |
|---|---|---|
| 问题层 | 语义模糊 | "某些条件下"未明 |
