1. 项目背景与研究动机
2025年NIPS会议上即将发表的这项研究,首次系统性地提出了针对多模态大语言模型(MLLM)的认知能力测评框架。就像人类需要通过入学考试评估基础认知能力一样,这项研究为AI模型设计了一套"科学家资格考试",从感知和理解两大维度检验模型的真实智能水平。
过去三年,我们看到GPT-4V、Gemini等MLLM在图像描述、视觉问答等任务上表现惊艳。但作为研究者,我们更关心的是:这些模型是否真正具备了科学家所需的认知能力?当面对需要深度推理的科研场景时,它们能否像人类科学家一样进行有效的观察、分析和决策?这正是本研究想要回答的核心问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 认知评估框架设计
2.1 感知能力测评体系
感知能力测试包含三个关键维度:
-
跨模态对齐:评估模型能否准确建立视觉元素与语言概念之间的对应关系。我们设计了包含2000个测试样本的基准集,涵盖科学图表、显微图像等专业视觉材料。
-
细粒度识别:测试模型对科学图像中微观特征的捕捉能力。例如在细胞图像中识别特定器,或在电路图中定位故障组件。评估指标包括:
- 局部特征召回率
- 异常检测准确度
- 比例关系判断正确率
-
动态场景理解:通过视频序列评估模型对科学实验过程的跟踪能力。典型任务包括:
- 化学反应过程阶段划分
- 物理实验中的能量转换追踪
- 生物运动模式识别
2.2 理解能力测评体系
理解能力测试则聚焦更高阶的认知技能:
-
因果推理:给定一组实验数据,要求模型推断可能的因果关系。我们采用反事实推理框架进行评估,测量模型回答"如果...那么..."类问题的准确率。
-
假设生成:评估模型根据观察现象提出可验证科学假设的能力。评分标准包括:
- 假设的可检验性
- 逻辑连贯性
- 创新程度
-
知识整合:测试模型跨学科知识的灵活应用能力。例如用物理原理解释生物现象,或将数学工具应用于化学问题求解。
3. 基准数据集构建
3.1 数据采集原则
我们遵循三个核心原则构建测评数据集:
-
领域覆盖度:包含物理、化学、生物、材料等基础学科,以及环境科学、医学等应用领域。
-
难度梯度:每个测试任务设
