1. 视频深度研究评测基准VideoDR的诞生背景
视频理解技术近年来取得了长足进步,但从实验室走向真实世界应用时,我们遇到了一个关键瓶颈:现有系统只能在封闭的视频内容中寻找答案,而无法像人类那样主动获取外部知识进行深度研究。这就是VideoDR评测基准诞生的根本原因。
想象这样一个真实场景:你在观看一段博物馆导览视频时,对其中一件展品产生了兴趣。你想知道"该博物馆推荐的展品中,距离这个展品最近的那件,其注册编号是多少?"这个问题需要:
- 理解视频内容(识别特定展品)
- 定位展品在博物馆中的位置
- 查询博物馆官网获取推荐展品列表
- 比对位置信息找到最近的展品
- 提取该展品的注册编号
传统视频问答系统完全无法处理这类任务,因为它们被设计为仅从视频内部提取信息。而VideoDR首次将视频理解与开放网络搜索能力结合起来,创造了一个更接近真实世界需求的评测体系。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. VideoDR的核心任务定义与技术挑战
2.1 三大核心能力维度
VideoDR定义了视频深度研究任务的三个关键能力维度:
-
多帧视觉线索提取:模型需要从连续视频帧中准确识别并关联关键视觉信息。例如在博物馆案例中,需要从不同角度的画面中确定展品的确切位置。
-
交互式网络搜索:系统必须在浏览器环境中执行多跳搜索。这不同于简单的API调用,需要模拟人类的搜索行为,包括:
- 根据视觉线索确定搜索关键词
- 浏览搜索结果并判断相关性
- 点击链接获取详细信息
- 可能需要进行多轮搜索迭代
-
多跳推理验证:将视频提取的线索与网络获取的证据进行交叉验证,最终给出可验证的事实性答案。这要求系统具备逻辑推理和事实核查能力。
2.2 数据集构建的严谨性
为确保评测质量,VideoDR团队采用了严格的人工标注流程:
-
双重依赖性筛选:每个问题都必须同时依赖视频内容和网络信息才能解答。剔除了以下两类简单样本:
- 仅通过视频内容就能回答的问题
- 仅通过网络搜索就能回答的问题
-
六大领域覆盖:数据集涵盖日常生活、经济、科技、文化、历史和地理领域,确保评测的广泛代表性。
-
真实场景模拟:所有问题都基于真实用户可能提出的信息需求设计,避免人为构造的学术
