1. 当AI搜索助手遇上真实世界:GISA基准测试的启示
最近在arXiv上读到一篇关于AI搜索助手的论文,结果让我这个从业者既震惊又兴奋。研究人员构建了一个名为GISA的基准测试,专门评估AI在复杂信息搜寻任务中的表现。最令人意外的是,即便是当前最先进的Claude 4.5 Sonnet模型,准确率也只有19.3%,远低于人类专家的78%。这个差距之大,让我不得不重新思考AI搜索助手的现状和发展方向。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 为什么现有基准测试不够用?
2.1 传统基准测试的致命缺陷
现有的搜索代理基准测试(如BrowseComp)存在一个根本性问题:它们都是"反向构建"的。研究人员先确定答案,再反推问题。这种做法看似合理,实则隐藏着三个严重缺陷:
-
问题不自然:反推的问题往往过于直白,缺乏真实搜索场景中的复杂性和模糊性。比如,真实用户可能会搜索"2024年物理学最高奖项",而基准测试则会直接问"谁获得了2024年诺贝尔物理学奖"。
-
覆盖片面:大多数基准测试要么只关注"深度推理"(定位单一关键信息),要么只测试"广度聚合"(收集多个相关信息),很少同时考察这两种能力。
-
数据污染风险:静态的答案集容易被模型在训练过程中"记住",导致测试结果虚高,不能反映真实能力。
2.2 GISA的创新解决方案
GISA基准测试采用了一种全新的构建方法:
-
从真实需求出发:标注人员通过实际浏览网页来激发真实问题,确保问题的自然性和复杂性。
-
结构化答案格式:设计了四种明确的答案格式(Item、Set、List、Table),使评估更加客观和可量化。
-
动态更新机制:25%的问题属于"实时子集",答案会定期更新,有效防止模型通过记忆作弊。
3. GISA基准测试的设计细节
3.1 四阶段构建流程
GISA的构建过程非常严谨,分为四个阶段:
-
头脑风暴:基于10个领域(科技、艺术、历史等),标注人员通过实际浏览网页来激发真实问题。
-
查询细化:将原始问题转化为正式查询,同时确定答案格式。关键要求是任务必须同时需要"深度推理"和"广度信息聚合"。
-
人工标注:使用定制浏览器扩展记录专家的完整搜索轨迹,包括搜索查询、点击链接和时间戳等。
-
质量检查:验证轨迹日志的一致性、答案的准确性和格式合规性,并进行"记忆检查"排除那些仅靠模型内部知识就能回答的题目。
3.2 四种结构化答案格式
GISA设计了四种结构化答案格式,每种都有明确的评估标准:
| 格式 | 描述 | 示例查询 | 评估方法 |
|---|---|---|---|
| Item | 单个事实或值 | "2024年世界杯决赛举办地" |
