1. CNN与Transformer融合技术全景解析
计算机视觉领域正经历一场前所未有的架构革命。三年前Transformer首次在NLP领域大获成功后,视觉研究者们就开始探索如何将这种基于自注意力机制的强大模型引入图像处理任务。然而,最初的ViT(Vision Transformer)在中小规模数据集上的表现并不尽如人意,这促使研究者们重新审视CNN与Transformer的关系——不是非此即彼的替代,而是优势互补的融合。
1.1 为什么需要融合?
CNN的卷积核就像一位专注细节的显微镜专家,能够精确捕捉局部纹理和空间层次特征。但当面对需要理解全局语义的场景时(比如判断X光片中肿瘤与周围组织的整体关系),CNN的感受野限制就成为明显短板。反观Transformer,其自注意力机制天生具备全局建模能力,可以像卫星遥感一样把握图像各部分的关联性,但在处理细微纹理(如皮肤病变的边缘渐变)时却显得"粗枝大叶"。
更关键的是计算效率问题:标准Transformer的复杂度与图像分辨率呈平方关系,处理512x512的医学图像时,计算量会变得难以承受。而CNN的平移不变性和局部连接特性,使其在计算效率上具有天然优势。
1.2 主流融合范式剖析
当前顶会论文中主要呈现三种融合思路:
双分支并行架构(如VQ模型):
- CNN分支:采用轻量化的MobileNetV3处理底层细节
- Transformer分支:使用改进的Swin Transformer建模全局关系
- 融合点:在多个尺度进行特征交互,最后通过可学习权重动态整合
这种架构在SAR图像去噪任务中,将结构相似性指标(SSIM)从0.73提升到0.89,同时保持实时推理速度。
级联混合架构(如MSLAU-Net):
- 浅层:使用3层CNN提取局部特征
- 中层:引入轴向注意力模块过渡
- 深层:纯Transformer块进行全局推理
- 解码器:采用跨尺度跳跃连接
在肝脏CT分割任务中,这种设计将Dice系数提升6.2%,同时参数量减少18%。
注意力增强型CNN:
- 保留CNN主干网络
- 在关键位置插入:
- 空间注意力模块(关注"哪里"重要)
- 通道注意力模块(关注"什么"重要)
- 混合注意力块(二者结合)
Kaggle
