1. CREval框架:创意图像生成评估的新范式
在AIGC技术爆发的当下,图像生成模型已经能够处理"将客厅改造成赛博朋克风格"或"给这只猫穿上宇航服"等复杂创意指令。但当我尝试用不同模型生成同一指令时,发现结果质量参差不齐——有的完美还原细节却丢失了主体结构,有的风格惊艳但出现了六根手指。这引出一个关键问题:我们该如何系统评估模型在复杂创意任务中的表现?
传统评估方法主要针对物体增减、简单属性修改等基础编辑任务,就像用选择题考核艺术创作能力。CREval的创新之处在于,它专门设计了针对"创意自由度"的评估体系。其核心思路是将主观的艺术评判转化为可量化的多维指标,就像把米其林餐厅的"用餐体验"拆解为食材、服务、环境等具体评分项。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. CREval-Bench数据集构建解析
2.1 数据采集的巧思
团队构建的CREval-Bench包含874张图像和13K问答对,这个规模在创意评估领域堪称豪华。但更值得关注的是其数据筛选策略:
- 来源多样性:混合使用公开数据集(如COCO)和网络爬取图像,确保覆盖不同场景
- 指令生成:用GPT-4o生成编辑指令时,会先提供"把人物变成乐高积木风格"等种子示例,引导生成富有创意的指令
- 质量把控:每张图像平均对应15个问答对,问题覆盖率经人工验证达80%
实践发现:单纯增加数据量不如提升指令复杂度。最终数据集包含"超现实改造"、"风格迁移"、"逻辑推理编辑"三大创意类型,每个类型下又细分9个维度。
2.2 评估维度的科学设计
框架从三个核心维度进行评估,每个维度都经过精心设计:
-
指令遵循(IF)
- 检查是否完成所有编辑要求
- 示例问题:"图像中人物的服装是否变成了指定的中世纪风格?"
-
视觉一致性(VC)
- 评估背景/未修改部分的保持程度
- 采用加权评分(关键元素权重0.7,次要元素0.3)
-
视觉质量(VQ)
- 检测常见生成缺陷
- 包含"人物手指数量是否正常"等具体问题

