1. 机器人操作评估的现状与挑战
在机器人技术快速发展的今天,视觉-动作(VA)和视觉-语言-动作(VLA)模型已经显著提升了机器人的操作能力。然而,评估这些操作行为的方法却相对滞后,这直接影响了我们对机器人实际能力的准确判断。当前主流的评估方法存在两个关键缺陷:
首先,大多数评估仅依赖于二元成功率指标。这种简单粗暴的评估方式无法区分"勉强完成任务"和"优雅完成任务"之间的本质区别。举个例子,一个机器人可能通过反复碰撞和调整最终将杯子放到指定位置,而另一个机器人则能流畅、精准地完成相同任务。按照传统评估标准,两者都会被记为"成功",但这显然掩盖了重要的性能差异。
其次,现有评估缺乏对行为真实性的验证。在演示视频中,我们很难区分哪些是机器人自主完成的操作,哪些是经过人为干预或远程操控的结果。这种来源真实性的缺失,使得评估结果的可信度大打折扣。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Eval-Actions基准测试的创新设计
2.1 数据集构建理念
Eval-Actions基准测试的创新之处在于它突破了传统数据集的局限。与仅包含成功演示的常规数据集不同,它特意包含了以下关键元素:
- 2800条失败案例:这些数据对于理解机器人的错误模式和恢复能力至关重要
- 多源数据混合:既包含人类远程操作数据,也包含VA和VLA策略生成的轨迹
- 细粒度标注:每个样本都配有专家评分、排序引导偏好和思维链三种监督信号
这种设计使得Eval-Actions能够支持更全面、更真实的评估场景。数据集总时长约52小时,包含13,000条轨迹,覆盖150多种不同任务,使用了包括ARX R5、UR5等多种机械臂配置。
2.2 细粒度动作质量定义
Eval-Actions提出了一个系统化的动作质量评估框架,基于四个核心维度:
- 成功率:二元指标,判断任务是否完成
- 平滑度:通过关节角速度和加速度方差量化运动流畅性
- 安全性:监测并惩罚意外碰撞等危险交互
- 效率:根据任务完成时间评估,并针对不同初始条件进行归一化
这种多维度的评估体系能够更准确地反映机器人的实际表现。例如,在餐具摆放任务中,一个动作抖动但最终完成任务的机器人,其评分将明显低于动作流畅、无碰撞的机器人。
