1. 研究背景与问题发现
在计算机视觉领域,Vision Transformer(ViT)已经成为继CNN之后的新一代骨干网络架构。然而,香港大学和中山大学联合团队在CVPR 2026的最新研究中揭示了一个令人震惊的事实:我们可能一直在错误地训练ViT模型。这项名为"LaSt-ViT"的研究发现,当前主流ViT训练方法存在系统性缺陷,导致模型实际上是在"看背景"而非"看前景"。
研究团队通过一系列精心设计的实验证实了这一现象。最直接的证据来自一个关键测试:当遮掉ViT认为最重要的前50%图像块(patch)时,ImageNet分类准确率基本保持不变(ViT-B/16甚至微升1.2%);而遮掉低分patch时准确率却大幅下降。这个反直觉的结果暗示,ViT所依赖的"重要信息"实际上大量分布在背景区域。定量分析显示,ViT的高分patch只有42.7%位于前景物体内(Point-in-Box指标),远低于ResNet的68.4%。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 问题根源的三重分析
2.1 训练初期的偏好形成
通过追踪ViT从零开始的训练过程,研究人员发现模型从训练初期就表现出对背景区域的强烈偏好。这种倾向在整个训练过程中持续存在且难以纠正。相比之下,CNN架构(如ResNet)则自然地倾向于关注前景物体。这种差异可能与两种架构处理空间信息的方式有关:CNN的局部感受野强制模型关注局部特征,而ViT的全局注意力机制从一开始就允许模型自由选择任何区域的信号。
2.2 监督信号的固有局限
当前主流的监督学习范式(如图像级标签)只告诉模型"图片中包含什么",而不指明"物体具体在哪里"。这种粗粒度的监督信号实际上鼓励了模型的"懒惰"行为——既然背景区域通常占据图像大部分面积,且包含丰富的上下文信息,模型自然会选择利用背景特征作为分类的捷径。研究团队通过增大patch size的实验验证了这一点:当背景patch数量减少时,模型的定位能力(Point-in-Box)有所提升,但分类准确率却显著下降,说明模型确实依赖背景信息进行分类。
2.3 全局注意力的双刃剑效应
ViT的核心创新——全局注意力机制本应帮助模型理解图像的整体语义,但实际上却成为前景信息"泄漏"到背景的通道。实验表明,当用局部窗口注意力替代全局注意力时,空间定位能力明显改善(Point-i
