1. 项目背景与研究动机
计算机视觉领域近年来在高层语义理解方面取得了显著进展,但在基础视觉感知能力方面仍存在明显不足。深圳大学联合研究团队在CVPR 2026发表的OddGridBench研究揭示了一个有趣现象:当前最先进的大规模视觉模型在"找不同"这类基础视觉任务上的表现,竟然远逊于人类儿童的水平。
这个发现挑战了我们对视觉模型能力的传统认知。通常认为,随着模型规模的扩大和训练数据的增加,模型在各项任务上的表现都会同步提升。但OddGridBench实验表明,某些基础视觉能力的发展可能遵循不同的规律,不能简单地通过扩大模型规模来解决。
关键发现:当面对包含细微差异的网格图像时,人类受试者平均仅需2.3秒就能准确识别差异位置,而参数量超过100B的视觉大模型正确率不足60%,且响应时间长达15秒以上。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. OddGridBench基准设计原理
2.1 任务形式与评估指标
OddGridBench采用网格对比范式,每组测试包含两张看似相同的N×N网格图像,其中仅有一个网格单元存在差异。差异类型包括:
- 颜色差异(色相、饱和度或亮度变化)
- 纹理差异(图案方向或密度变化)
- 形状差异(几何变形或轮廓变化)
- 复合差异(上述多种变化的组合)
评估采用三项核心指标:
- 准确率:正确识别差异位置的比率
- 响应时间:从呈现图像到做出响应的时间
- 鲁棒性:对噪声、遮挡等干扰因素的抵抗能力
2.2 难度分级体系
基准包含五个难度等级:
- 初级(5×5网格,高对比度差异)
- 中级(7×7网格,中等对比度)
- 高级(10×10网格,低对比度)
- 专家级(动态网格,差异随时间变化)
- 终极挑战(复合网格,多个差异维度)
这种分级设计使得基准能够全面评估从基础到复杂的视觉感知能力,同时为模型改进提供明确的方向指引。
3. 关键技术实现方案
3.1 人类视觉系统模拟
研究团队开发了基于注意力机制的视觉感知模拟器(VPS),其核心组件包括:
- 初级特征提取层:模拟视网膜和V1区的局部感受野
- 动态注意力机制:模拟人类眼跳和焦点转移
- 全局-局部协同处理:整合中央凹高分辨率与周边视野信息
python复制class VisualPerceptionSimulator(n
