1. 多模态Agent评测的现状与挑战
当前AI领域最令人振奋的进展之一,就是多模态大模型在视觉理解能力上的突破。从GPT-4V到Gemini 1.5,这些模型在标准测试集上展现出的图像理解能力常常令人惊叹。然而,当我们把这些"实验室优等生"放到真实世界场景中,它们的表现却往往令人大跌眼镜。
我最近参与了一个家居装修项目,尝试让几个主流的多模态Agent协助完成一些实际任务。其中一个典型场景是:我需要根据客厅照片选择匹配的木地板,并计算所需材料和费用。理论上,这正是多模态Agent应该擅长的领域——理解图像内容、检索产品信息、进行简单计算。但实际操作中,这些"智能助手"的表现却问题百出:
- 一个模型将照片中浅橡木色的地板识别为"深胡桃木"
- 另一个模型虽然正确识别了材质,却在计算面积时漏掉了走廊区域
- 最令人哭笑不得的是,某个顶级模型提供的地板购买链接,竟然指向完全不同的产品
这些失败案例并非孤例。香港科技大学、浙江大学等机构联合发布的AgentVista评测基准,系统地揭示了当前多模态Agent在真实场景中的能力局限。这个包含209个任务的测试集覆盖了技术维修、商业决策、地理导航等7大领域,结果发现即使是最强的Gemini-3-Pro模型,整体准确率也只有27.27%。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. AgentVista评测基准的设计理念
2.1 现有评测体系的不足
传统多模态评测存在两个致命缺陷,导致它们无法真实反映Agent的实际能力:
首先是能力碎片化问题。大多数评测就像学校的单项考试——有的只测试图像裁剪缩放这样的基础操作,有的只评估网页浏览能力,还有的专注于代码生成。这种割裂的评测方式,完全无法评估Agent在复杂任务中协调多种技能的表现。
第二个问题是真实性与难度的失衡。为了提高测试难度,很多评测会简化视觉输入或采用非自然的工具调用方式。比如VisualToolBench会对输入图像进行预处理,使其更适合特定视觉操作。这种做法虽然方便评测,却让测试远离了真实世界的混乱与复杂。
2.2 AgentVista的三大创新设计
AgentVista基准的建立基于三个核心原则:
- 以视觉为中心:每道题的关键证据必须从图像中获取。这些图像都是真实拍摄或截取的,包含细微但关键的视觉线索——产品标签上的小字、电路板上的芯片
