1. 项目背景与核心价值
在计算机视觉领域,目标检测算法的性能提升一直是研究热点。YOLO系列作为实时目标检测的标杆算法,其改进工作备受关注。最近我在复现YOLOv6时发现,现有模型在处理密集小目标场景时存在明显的漏检和误检问题。这主要源于传统特征融合方式对高频细节信息的处理不足——当多个小目标密集排列时,低频的语义信息容易淹没高频的位置和纹理特征。
TPAMI 2024最新提出的FreqFusion模块给了我很大启发。这个频域感知的特征融合方案,通过离散余弦变换(DCT)将特征图分解到频域,实现了不同频率成分的针对性增强。实测表明,在VisDrone-DET2021这类密集小目标数据集上,改进后的YOLOv6-m模型mAP@0.5提升了7.2%,推理速度仅下降3fps(Tesla T4环境)。这种改进对于无人机航拍、医学影像分析等场景具有显著实用价值。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 频域特征融合原理剖析
2.1 传统特征融合的局限性
现有YOLO系列普遍采用FPN+PAN的结构进行多尺度特征融合。这种空间域的直接相加/拼接操作存在两个固有缺陷:
- 高频噪声放大:浅层特征中的高频细节(如边缘纹理)会携带大量噪声,直接融合会导致特征污染
- 低频信息压制:深层特征的强语义信息会压制浅层的几何特征,导致小目标定位精度下降
2.2 FreqFusion的频域解耦策略
FreqFusion的创新点在于将特征图转换到频域进行处理:
- 分块DCT变换:将特征图划分为8x8小块,分别进行DCT变换,得到频率分量矩阵
- 频带掩码生成:设计可学习的频带权重矩阵,公式如下:
code复制其中F_low/F_mid/F_high分别对应DCT系数的低频/中频/高频区域W = σ(Conv([F_low; F_mid; F_high])) - 动态融合机制:对不同频带实施差异化处理:
- 低频分量:加强通道注意力(采用SE模块)
- 高频分量:添加空间注意力(CBAM模块)
- 中频分量:保留原始特征
关键技巧:DCT变换前需要对特征图进行零均值化处理,避免直流分量过大影响频带分布。
3. YOLOv6改进实施方案
3.1 模型架构调整
在YOLOv6-m的Neck部分进行如下改造
