1. RoboBrain 2.5:具身智能的时空认知革命
当机器人需要完成"用喷壶从左到右给花朵浇水,每朵花上方1-5厘米处悬停"这类精确操作时,传统视觉-语言-动作(VLA)模型往往力不从心。这正是RoboBrain 2.5要解决的核心问题——让具身智能体真正理解三维空间的度量关系和时间维度的任务进展。作为北京智源最新发布的具身人工智能基础模型,RoboBrain 2.5通过两项关键创新,将机器人的物理交互能力提升到新高度:精确的3D空间推理和密集时间值估计。
我在实际测试中发现,传统模型在处理这类需要精确空间度量的任务时,通常存在两个致命缺陷:一是无法从单目视觉输入中重建精确的三维坐标,二是缺乏对任务执行进度的细粒度监控。RoboBrain 2.5的创新之处在于,它不仅能看到深度,还能在思维中建模时间,这使得机器人可以像人类一样,在执行任务时同时考虑"现在在哪里"和"接下来怎么做"这两个关键问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术解析
2.1 精确三维空间推理框架
2.1.1 三维空间参照与测量
RoboBrain 2.5的空间推理能力建立在三个相互支撑的技术支柱上:空间参照、空间测量和空间追踪。空间参照系统让模型能够准确解析像"从左到右第三朵花"这样的指令,其核心创新在于将传统的2D边界框检测升级为3D场景图理解。
具体实现上,模型首先通过改进的ViT架构提取视觉特征,然后结合来自GroundingDINO的物体检测结果和UniDepth V2的深度估计,构建伪3D场景图。这个过程中最关键的突破是引入了度量感知的坐标转换模块,可以将图像中的2D点映射到以机器人基座标系为参考的3D坐标。例如,当识别到花盆时,模型不仅能确定它在图像中的位置,还能计算出它距离机器人底座的实际距离——这是执行精确操作的前提条件。
实际应用中发现,深度估计的精度直接影响最终操作效果。在1米工作距离内,RoboBrain 2.5能达到±1cm的定位精度,这已经满足大多数精细操作任务的需求。
2.1.2 三维空间轨迹生成
传统方法通常将轨迹规划视为独立的后续处理步骤,而RoboBrain 2.5的创新在于将轨迹生成直接融入视觉理解过程。模型会输出一系列带有时间戳的3D关键点,形成完整的操作轨迹。例如在浇花任务中,它会生成包含如下信息的轨迹序列:
