1. 项目概述
在人工智能领域,视频生成技术近年来取得了显著进展,但一个长期存在的"物理恐怖谷"问题始终困扰着研究者们——生成的视频虽然在视觉上足够逼真,却在物理规律、动作合理性和任务逻辑性方面频频出现违和感。想象一下,一个看似精美的烹饪视频中,食材却违反重力悬浮在空中;或者一个机器人操作演示中,机械臂的运动轨迹明显违背了运动学原理。这种视觉真实性与物理合理性之间的割裂,正是我们团队希望通过ReWorld框架解决的核心问题。
传统视频生成模型(如Cosmos、CogVideoX等)主要关注像素级的视觉质量评估,使用FVD、SSIM等指标优化生成效果。然而,这种单一维度的优化方式无法捕捉到视频内容在物理世界中的合理性。就好比评价一部电影,如果只看画面清晰度而忽略剧情逻辑和角色行为合理性,最终作品必然难以令人信服。ReWorld的创新之处在于,我们首次将视频评估拆解为四个正交维度:物理真实性(物体运动是否符合牛顿定律)、具身合理性(机器人动作是否符合运动学)、任务完成度(行为是否达成预设目标)以及视觉质量(画面细节和连贯性)。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心方法解析
2.1 HERO分层奖励模型设计
HERO(Hierarchical Embodied Reward Observer)模型是我们解决多维评估问题的核心创新。其架构设计借鉴了人类认知系统的层次性特点:
-
底层特征提取:基于InternVideo2视觉主干网络,构建共享的特征金字塔。不同层级的特征图天然对应不同抽象级别的信息——浅层网络捕捉边缘、纹理等低级视觉特征,深层网络则提取语义、关系等高级特征。
-
专用奖励头设计:
- 物理真实性头:连接至网络浅层,分析物体运动轨迹、碰撞检测等基础物理特性。采用3D卷积+时空注意力机制,计算如"物体是否自由落体"、"碰撞后动量是否守恒"等指标。
- 具身合理性头:针对机器人动作,接入中层特征,通过预训练的运动学模型评估关节角度、末端执行器轨迹的可行性。
- 任务完成度头:利用深层语义特征,结合CLIP等跨模态模型,判断动作序列是否达成预设目标(如"成功倒水入杯")。
- 视觉质量头:独立评估画面细节,使用对抗训练方式确保生成质量不因其他维度的优化而下降。
-
损失函数创新:
- 维度特异性损
