1. 项目概述
今天要和大家分享的是我们团队在图像恢复领域的最新研究成果——DHOGSA(Dynamic HOG-aware SelfAttention)模块。这个基于Transformer的创新设计,通过将传统HOG特征与自注意力机制巧妙结合,在PSNR指标上实现了显著提升(最高达1.2dB)。最令人兴奋的是,这个模块可以即插即用到现有视觉模型中,不需要改变主干网络结构。
我在实际测试中发现,对于低光照、运动模糊等常见退化场景,引入DHOGSA后模型的边缘保持能力提升尤为明显。下面就从技术原理到代码实现,带大家完整解析这个创新模块。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心设计思路
2.1 为什么选择HOG作为先验
HOG(方向梯度直方图)是计算机视觉领域的经典特征描述子,其核心优势在于对局部梯度方向的统计建模。与传统CNN特征相比,HOG具有几个独特优势:
- 旋转不变性:通过梯度方向直方图的统计,对物体旋转具有一定鲁棒性
- 光照不变性:梯度计算对整体光照变化不敏感
- 结构敏感性:能精确捕捉边缘、角点等结构特征
我们在消融实验中发现,直接将原始HOG特征与RGB特征拼接效果有限(PSNR提升仅0.3dB左右)。关键在于如何让HOG特征动态引导注意力权重分配。
2.2 双路径注意力设计
DHOGSA采用如图所示的并行结构:
code复制[输入特征] → [HOG特征提取分支] ↘
[动态特征融合] → [输出]
[RGB特征分支] ↗
HOG分支关键技术点:
- 使用3×3 Sobel算子计算梯度
- 将图像划分为8×8的cell,每个cell计算9方向的直方图
- 采用L2-Hys归一化方法
动态融合机制:
python复制class DynamicFusion(nn.Module):
def __init__(self, dim):
super().__init__()
self.hog_proj = nn.Linear(dim, dim)
self.rgb_proj = nn.Linear(dim, dim)
self.gate = nn
