1. 项目背景与技术演进
在图像恢复领域,Transformer架构近年来展现出超越传统CNN方法的潜力。但传统自注意力机制存在计算复杂度高、长程依赖建模效率低等问题。2023年提出的MB-TaylorFormer首次将泰勒展开近似与多分支结构结合,在保持线性复杂度的同时提升了局部-全局特征融合能力。本次V2版本通过三方面关键改进,在多个图像恢复任务上实现了新的SOTA性能。
注:图像恢复任务包括去噪、超分、去模糊等,其核心挑战在于如何平衡感受野范围与计算效率
1.1 核心创新点解析
V2版本的突破性改进集中在以下三个维度:
-
动态阶数泰勒展开:根据图像区域复杂度自动调整泰勒展开阶数(1-3阶),相比V1的固定2阶展开,在平滑区域减少计算量,在纹理丰富区域提升近似精度。实测在BSD100数据集上,计算量减少23%的同时PSNR提升0.18dB。
-
分支间特征门控:新增跨分支特征选择机制,通过可学习权重动态融合不同分支的特征。具体实现采用轻量级门控网络(仅3层MLP),参数量增加不到1%却带来显著的性能提升。
-
混合精度计算架构:关键路径采用FP16计算,配合梯度缩放技术,在RTX 4090上训练速度提升1.8倍,显存占用降低40%,使模型可扩展到更大的输入尺寸。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 模型架构详解
2.1 泰勒展开注意力机制
传统自注意力计算复杂度为O(N²),而泰勒展开近似将其降为O(N)。具体实现步骤:
python复制# 泰勒展开近似注意力计算 (以2阶为例)
def taylor_attention(Q, K, V):
# 线性投影
q = linear_proj(Q) # [B,N,d]
k = linear_proj(K) # [B,N,d]
# 一阶项计算
first_order = torch.einsum('bnd,bmd->bnm', q, k)
# 二阶项计算
q_sq = q.pow(2)
k_sq = k.pow(2)
second_order = 0.5 * torch.einsum('bnd,bmd->bnm', q_sq, k_sq)
# 注意力
