1. 项目概述
LaST₀(Latent Spatio-Temporal Chain-of-Thought)是2026年初由北京大学、北京人形机器人创新中心、香港中文大学和Simplexity Robotics联合提出的机器人视觉-语言-动作(VLA)模型创新框架。这个模型的核心突破在于实现了机器人"直觉式思考"——通过在潜空间进行时空推理,既保留了人类思考的深度,又达到了机器执行的速度要求。
关键创新点:用潜码(Latent Tokens)替代传统显式思维链(如语言或图像),推理速度提升3倍以上(达到15.4Hz),在RLBench测试环境中的平均任务成功率提升12.7%。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心原理与技术架构
2.1 潜空间思维链设计
传统VLA模型的显式思维链(如CoT-VLA生成未来图像)存在两大瓶颈:
- 计算冗余:生成完整图像需要约800ms/帧,而机器人控制需要50-100ms级响应
- 信息损失:语言描述难以精确表达物体几何特征(如曲面曲率)和动力学特性(如摩擦系数)
LaST₀的解决方案是构建五维潜空间:
- 2D视觉特征(来自SigLIP编码器)
- 3D几何特征(来自Uni3D点云编码器)
- 机器人本体状态(关节角度、末端力觉)
- 时间维度(Δt=0.1s的离散时间步)
- 任务语义(来自DeepSeek-LLM的嵌入)
python复制# 潜空间构建伪代码
def build_latent_space(rgb_img, point_cloud, robot_state):
visual_feat = siglip_encoder(rgb_img) # 2D视觉特征
geometric_feat = uni3d_encoder(point_cloud) # 3D几何特征
state_feat = mlp(robot_state) # 本体状态编码
return torch.cat([visual_feat, geometric_feat, state_feat], dim=-1)
2.2 双专家协同系统
模型采用Mixture-of-Transformers(MoT)架构,包含两个异步运行的专家模块:
| 模块 | 运行频率 | 输入输出 | 关键技术 |
|---|---|---|---|
| 推理专家 | 4Hz | 当前观测→未来潜码序列 | 自回归预测+KV缓存 |
| 行动专家 | 16Hz | 当前观测+缓存潜码→机器人动作 | 流匹配(Flow Matching) |
这种设计模仿了人类的"直觉-动作"机制:
- 慢系统(推理专家):像象棋大师预判多步棋局,每250ms生成未来1秒的潜码轨迹
- 快系统(行动专家):像运动员的肌肉记忆,每62.5ms根据最新观测调整动作
3. 关键实现细节
3.1 流匹配动作生成
行动专家采用条件流匹配(CFM)生成平滑动作序列。给定目标潜码z_t和当前状态s_t,动作a_t的生成过程:
- 构建噪声轨迹:âₜ = aₜ + ε, ε∼N(0,σ²I)
- 训练得分网络:∇ₐ̂log pₜ(âₜ|sₜ,zₜ)
- 采样时通过ODE求解:
daₜ/dt = -σ²∇ₐlog pₜ(aₜ|sₜ,zₜ)
实测表明,相比传统ProMP方法,CFM在擦白板任务中使轨迹平滑度提升23%,位置误差降低15%
3.2 跨模态注意力机制
推理专家内部采用改进的跨模态注意力:
code复制Attention(Q,K,V) = Softmax(QKᵀ/√d + M)V
其中掩码矩阵M包含三种约束:
- 时间因果掩码(未来不能影响过去)
- 模态优先级(3D几何特征权重>2D视觉)
- 物理约束(如机械臂工作空间限制)
4. 实验与性能分析
4.1 基准测试结果
在RLBench环境中的对比实验(成功率%):
| 任务 | LaST₀ | CoT-VLA | π0.5 | 提升幅度 |
|---|---|---|---|---|
| 关微波炉门 | 92.3 | 81.7 | 88.5 | +10.6 |
| 叠盘子 | 85.1 | 72.4 | 80.2 | +12.7 |
| 铲鸡蛋 | 78.6 | 65.3 | 70.8 | +13.3 |
4.2 实时性测试
在NVIDIA RTX 4090上的推理速度:
| 模型 | 频率(Hz) | 延迟(ms) | 显存占用(GB) |
|---|---|---|---|
| LaST₀ | 15.4 | 65 | 6.8 |
| CoT-VLA | 4.2 | 238 | 9.3 |
| Open-VLA | 8.7 | 115 | 7.1 |
5. 工程实践建议
5.1 部署优化技巧
-
KV缓存量化:将推理专家的Key-Value缓存从FP16转为INT8,可使显存占用降低40%而精度损失<1%
-
动作插值:当行动专家输出频率高于机器人控制频率时,采用三次样条插值避免抖动
-
故障恢复策略:
- 潜码预测置信度<0.7时触发重推理
- 连续3次低置信度则回退到经典PID控制
5.2 常见问题排查
| 现象 | 可能原因 | 解决方案 |
|---|---|---|
| 动作卡顿 | 推理专家输出延迟 | 检查KV缓存命中率 |
| 末端执行器抖动 | 流匹配温度参数过高 | 调整σ从0.3→0.1 |
| 长期任务失败 | 潜码预测累积误差 | 每5秒插入真实观测重新初始化 |
6. 应用场景扩展
LaST₀框架已成功应用于:
- 医疗机器人:达芬奇手术器械的自主避障
- 家庭服务:处理变形物体(如叠衣服)的成功率提升19%
- 工业检测:在奔驰生产线实现螺丝质检+自动复紧一体化
我们团队在真实机器人上部署时发现,针对特定场景微调潜空间维度分配能显著提升性能。例如装配任务中,将3D几何特征的潜码占比从30%提升到50%,可使插入精度提高0.2mm
