1. 项目背景与核心价值
去年在整理计算机视觉顶会论文时,我发现一个有趣现象:当前大模型在高层语义理解上突飞猛进,但在基础视觉感知任务上的表现却鲜少被系统评估。这就像一个人能滔滔不绝讨论哲学,却分不清眼前的两片树叶哪片有缺口——深圳大学团队提出的OddGridBench正是针对这个"灯下黑"问题设计的诊断工具。
这个基准测试的核心创新点在于:通过精心设计的网格化差异检测任务(Odd-One-Out),剥离掉语义理解的干扰,纯粹评估模型的底层视觉感知能力。就像给AI做视力检查表,只不过我们测试的不是近视度数,而是形状、纹理、空间关系等基础视觉特征的敏感度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术方案深度解析
2.1 数据集构建方法论
团队采用控制变量法生成测试样本,每个样本由5×5网格组成,其中24个元素为相同基础图案,1个为干扰项。关键设计在于干扰项的七种变异类型:
- 几何变异:角度旋转(15°-90°)、比例缩放(±10%-30%)
- 纹理变异:方向梯度变化(±45°)、空间频率调整(±20%)
- 结构变异:局部缺失(1-3个关键结构点)、拓扑变化(开环变闭环)
- 复合变异:上述两种以上变异的组合
这种设计精妙之处在于:
- 通过网格排布消除位置偏差
- 基础图案库包含200+种几何原型(从简单三角形到复杂分形)
- 变异程度采用心理物理学中的JND(Just Noticeable Difference)标定
2.2 评估指标体系
不同于传统准确率评估,团队设计了三级评价维度:
| 维度 | 测量指标 | 人类基准 |
|---|---|---|
| 敏感度 | 最小可检测变异阈值(JND值) | 2.3°旋转 |
| 鲁棒性 | 噪声干扰下的性能衰减斜率(dB) | -0.8dB |
| 泛化性 | 未见图案类型的迁移准确率 | 89% |
实测发现,当前最好的视觉大模型在旋转检测任务上的JND值为8.7°,是人类的3.78倍——这个差距相当于
