1. SAM 3D Body技术解析:重新定义单目人体姿态估计
在计算机视觉领域,从单张RGB图像中重建3D人体网格一直是一个极具挑战性的任务。传统方法往往在复杂姿态、严重遮挡或非常规视角下表现不佳,特别是对于手部和脚部等精细部位的估计更是如此。Meta团队最新提出的SAM 3D Body(3DB)模型通过多项技术创新,在这个领域实现了突破性进展。
1.1 核心技术创新点
3DB模型的核心突破主要体现在三个方面:
首先是全新的参数化人体表示——动量人体绑定(Momentum Human Rig,MHR)。与广泛使用的SMPL模型不同,MHR将骨骼结构与表面形状明确解耦。这种解耦带来了几个显著优势:
- 参数直接对应骨骼长度,提高了模型的可解释性
- 允许更精确的局部控制,特别是对手指等细节部位
- 减少了身体不同部位参数之间的相互干扰
其次是创新的模型架构设计。3DB采用了可提示的编码器-解码器架构,灵感来源于Segment Anything Model(SAM)系列。这种设计允许模型接受多种形式的提示输入,如2D关键点或分割掩码,在图像质量较差或存在歧义时提供额外引导。架构上采用共享图像编码器配合两个独立解码器(身体和手部)的设计,有效解决了身体和手部优化目标冲突的问题。
第三个突破是强大的数据引擎。研究团队构建了一个包含700万张高质量标注图像的训练集,通过多阶段标注流程确保数据质量:
- 使用视觉语言模型自动识别和挖掘具有挑战性的样本
- 结合手动标注、密集关键点检测和多视图几何约束
- 采用参数化优化生成精确的3D网格标注
1.2 模型架构详解
3DB的架构设计充分考虑了全身人体网格恢复的特殊需求。图像编码器部分支持两种可选提示:2D关键点和分割掩码。关键点提示通过位置编码与可学习嵌入结合后输入解码器,而掩码提示则通过卷积嵌入后与图像特征逐元素相加。
解码器部分采用双分支设计:
- 身体解码器:处理全身姿态估计
- 手部解码器:专门优化手部姿态
这种设计解决了传统方法中手部估计受限于全身优化的问题。在推理时,模型默认使用身体解码器的输出,但当检测到手部存在时,会结合手部解码器的结果进行优化,特别是通过使用肘部和手腕位置作为提示来避免相邻关节的错误。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
