1. 项目概述:当AI学会"边看边想边行动"
ThinkAct项目提出了一种突破性的多模态推理框架,让AI系统能够像人类一样实现视觉-语言-动作的闭环决策。这个框架的核心创新在于将视觉潜在空间规划(Visual Latent Planning)与强化学习相结合,构建了一个可以自主迭代优化的智能体系统。
在实际测试中,搭载ThinkAct框架的机器人能够完成需要多步骤推理的复杂任务。比如当收到"把厨房里最重的锅放到洗碗机"这样的指令时,系统会:
- 通过视觉识别定位所有锅具
- 估算它们的重量(通过尺寸、材质等视觉线索)
- 规划最优移动路径
- 在操作过程中持续调整夹取力度
这种"看-想-做"的连贯能力,正是当前具身智能(Embodied AI)研究中最前沿的突破方向。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术解析
2.1 视觉潜在规划的三重编码机制
ThinkAct框架的核心是它的分层表示学习系统,包含三个关键组件:
-
视觉编码器:采用改进的ViT-H/16架构,在ImageNet-21K上预训练后,通过对比学习进行微调。特别的是,我们在空间注意力层添加了物理属性预测头(如质量、摩擦力系数),让模型能直接"理解"物体的物理特性。
-
语言-动作联合编码器:使用T5-large作为基础模型,创新性地加入了动作token嵌入。这些token不仅包含基础动作(抓取、移动等),还编码了力度、速度等连续参数。
-
潜在规划器:这是一个256维的LSTM网络,其特殊之处在于采用了课程学习策略。训练时先从2步规划开始,逐步增加到最多7步的复杂规划,这种渐进式训练使模型能稳定学习长程依赖。
实际部署中发现,在潜在空间维度超过300时会出现规划碎片化问题。经过大量实验,最终确定256维能在保持规划连贯性和计算效率间取得最佳平衡。
2.2 强化学习的双重奖励设计
框架的强化学习模块采用了混合奖励机制:
python复制def calculate_reward(state, action):
# 任务完成度奖励(稀疏奖励)
task_reward = env.get_task_completion_score()
# 物理合理性奖励(稠密奖励)
physics_pen
