1. 轴向注意力机制:解决UNet长程依赖问题的利器
医学图像分割领域长期面临一个核心挑战:如何在保持计算效率的同时,让模型能够捕捉图像中相距较远的像素之间的关联关系。传统UNet架构虽然通过编码器-解码器结构和跳跃连接实现了多尺度特征融合,但其核心组件——卷积神经网络(CNN)的局部感受野特性,使得模型难以建立全局上下文理解。
我在实际项目中发现,当处理CT扫描中的大器官(如肝脏)分割时,传统UNet经常无法准确识别器官边界处的细微变化。这是因为边界判断往往需要参考器官另一侧的特征,而标准3x3卷积核的有限感受野无法建立这种长距离关联。
1.1 轴向注意力的数学本质
轴向注意力的核心创新在于将二维自注意力分解为两个一维操作。具体来说,给定一个H×W的特征图:
- 行注意力(Row Attention)计算同一行内所有位置之间的关系
- 列注意力(Column Attention)计算同一列内所有位置之间的关系
这种分解将计算复杂度从O(H²W²)降低到O(HW² + H²W)。以512×512的医学图像为例,标准自注意力需要约6.87×10¹⁰次运算,而轴向注意力仅需约2.68×10⁸次——计算量减少了256倍。
注意:实际实现时通常会采用分组注意力进一步优化。例如将特征图分成16组,每组独立计算注意力,可使内存占用再降低一个数量级。
1.2 轴向注意力的三种变体
根据2026年最新研究,轴向注意力已经发展出多个改进版本:
-
位置敏感型轴向注意力:在注意力计算中显式加入相对位置编码,更适合需要精确定位的医学图像分割任务。公式如下:
code复制Attention(Q,K,V) = softmax((QK^T + R)/√d)V 其中R是相对位置偏置矩阵 -
多尺度轴向注意力:在不同分辨率特征图上应用轴向注意力,然后通过上采样融合结果。这种方法在MCANet中表现优异。
-
轴向稀疏注意力:只计算相邻k行的注意力关系(如k=8),在几乎不损失精度的情况下进一步降低计算量。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 轴向注意力与UNet的集成策略
2.1 瓶颈层替换方案
最直接的集成方式是用轴向注意力模块替换UNet瓶颈层(最底层的卷积块)。具体步骤:
- 在编码器路径末
