1. 项目概述:视觉-语言-动作模型的语义引导革新
在具身智能领域,视觉-语言-动作(VLA)模型长期面临一个尴尬局面:这些本该听懂人话的机器人,实际表现却像固执的视觉动物。想象一下,当你对厨房里的机器人说"请把灶台左边的蓝色马克杯递给我",它却径直抓取了最近的红色水杯——这正是中山大学团队在2025年8月发表的论文《Stable Language Guidance for Vision-Language-Action Models》要解决的核心问题。
传统VLA模型存在两种典型故障模式:一是"模态崩溃"(Modality Collapse),即视觉信号完全压制语言指令;二是"指令盲目性"(Instruction Blindness),模型对语言表述的微小变化极其敏感。就像人类在强光下会眯起眼睛,当前模型在强烈视觉刺激下也会"选择性失聪"。论文提出的残差语义引导(RSS)框架,本质上是为模型配备了一副"语义降噪耳机",通过数学方法剥离视觉干扰,让语言指令获得应有的注意力权重。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心原理拆解:从CFG到RSS的范式转变
2.1 传统CFG方法的局限性
分类器自由引导(Classifier-Free Guidance, CFG)本是扩散模型中的经典技术,其核心公式为:
code复制s_guided = s_conditional + γ*(s_conditional - s_unconditional)
其中γ是引导系数。在图像生成任务中,这种"质量增强"思路行之有效,但直接迁移到机器人控制场景就会引发严重问题。当γ=2时,模型对"请小心地拿起玻璃杯"这类修饰词会过度反应,而对"别碰那个杯子!"这样的否定指令却反应迟钝。
2.2 RSS框架的数学本质
RSS的创新在于重新诠释了无条件分数的物理意义。其核心公式看似简单:
code复制Δs = s(a|o,l) - s(a|o,0)
a_final = a_instinct + γ*Δs
但背后蕴含深刻的认知科学洞见:将s(a|o,0)视为"视觉本能先验",而非传统认为的"质量基底"。这相当于在神经网络的决策流中植入了一个"认知抑制"模块,就像人类在接到明确指令时会主动抑制习惯性动作。
关键洞见:当γ=1时,系统退化为纯指令跟随模式;γ=0则变成完全的本
