1. 项目概述:Envision基准测试的诞生背景
在2025年末,上海人工智能实验室发布了一项突破性的研究成果——Envision基准测试系统。这项研究直指当前AI图像生成领域最核心的缺陷:模型缺乏对时间流逝和因果关系的理解能力。就像一位只会画静物画的艺术家,再精美的单幅作品也无法展现故事的连贯发展。
研究团队由田俊曦、李思远等资深专家领衔,他们发现现有文本生成图像模型存在"理解-生成悖论":模型在理论上整合了理解和生成能力,但实际上这两种能力之间存在严重割裂。这种割裂导致模型可以生成视觉上令人惊艳的单张图片,却无法展现事件发展的连贯过程。
关键发现:当测试15个最先进AI模型时,即使是最优秀的模型在传统单图生成任务中表现出色,但在Envision测试中的表现却大幅下降,最好的GPT-4o模型在空间-时间一致性维度上仅获得67.42分。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Envision基准测试的核心设计
2.1 测试框架构建
研究团队精心设计了包含1000个四阶段事件序列的测试集,覆盖物理学、化学等六大领域。每个事件都被分解为四个关键阶段:
- 初始状态:事件开始的场景设定
- 早期互动:关键元素开始相互作用
- 渐进变化:事件发展的中间过程
- 最终结果:事件达到的终态
这种设计模拟了人类理解事件的认知过程,就像将一部电影分解为关键帧,要求AI不仅理解每个画面,更要把握它们之间的逻辑联系。
2.2 评分系统设计
Envision-Score评分系统从三个维度评估模型表现:
| 评估维度 | 考察重点 | 典型问题示例 |
|---|---|---|
| 一致性 | 事件逻辑是否连贯 | 角色服装在不同帧中是否一致 |
| 物理合理性 | 是否符合自然规律 | 物体运动轨迹是否遵循物理定律 |
| 美学质量 | 图像视觉吸引力 | 画面构图、色彩是否协调 |
这种多维评估避免了传统测试只关注画面质量的局限,真正检验AI对世界的理解深度。
3. 当前AI模型的根本缺陷
3.1 训练数据的局限性
现有模型主要使用孤立的单张图片进行训练,这造成了三个关键问题:
- 时间维度缺失:模型无法学习事件发展的动态过程
- 因果关系断裂:难以理解"因-果"之
