1. 当AI的视觉能力遇上三岁小孩:BabyVision揭示的多模态大模型短板
去年在朋友家做客时,他三岁的女儿让我印象深刻。小家伙拿着平板电脑玩一款连线游戏,手指沿着彩色线条滑动,准确地将不同形状的物体连接到对应颜色的篮子里。而就在同一天,我实验室里最新部署的多模态大模型Gemini Pro在同样的任务上频频出错。这个鲜明的对比让我开始思考:为什么在语言任务上表现出色的AI,在最基础的视觉任务上却不如一个幼儿园孩子?
UniPat AI团队最新发布的BabyVision评测集给出了科学答案。这个包含388道纯视觉题目的测试集,将顶尖AI模型与3-12岁儿童的视觉能力进行了系统对比。结果令人震惊:大多数模型的得分低于3岁儿童的平均水平,即使是表现最好的Gemini3-Pro-Preview,也仅相当于3岁半孩子的能力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. BabyVision评测体系的设计原理
2.1 为什么需要纯视觉评测?
传统多模态评测存在一个根本缺陷:很多所谓的"视觉"题目实际上可以通过语言推理解决。比如"图片中有几只猫"这样的问题,模型完全不需要真正理解图像,只需识别出"猫"这个文本标签并计数即可。BabyVision团队通过精心设计的题目,确保每道题都必须通过视觉信息本身来解决。
我在测试中发现一个典型案例:一道垃圾分类连线题要求将三个物品连接到对应颜色的垃圾桶。人类解题时会本能地沿着线条追踪,而模型却试图用语言描述路径("从A点向右移动,然后向下..."),最终在交叉点处混淆路径。这种差异揭示了AI视觉处理的本质缺陷。
2.2 四大核心视觉能力分解
BabyVision将视觉能力系统性地分解为四个维度:
-
精细辨别:测试模型对微小视觉差异的敏感度。例如在一组相似图案中找出不同之处,这类任务需要像素级的注意力。
-
视觉追踪:评估连续路径跟踪能力。包括线条追踪、运动轨迹预测等,这对自动驾驶等应用至关重要。
-
空间感知:测量三维空间理解能力。如方块计数、遮挡关系判断等,是机器人操作的基础。
-
视觉模式识别:考察图形规律归纳能力。要求从有限示例中抽象出视觉规则并推广到新情况。
3. 评测结果深度分析
3.1 模型与人类表现的巨大鸿沟
在BabyVision-Full测试中,
