1. YOLO-MIF网络架构解析
在目标检测领域,灰度图像的处理一直是个棘手问题。传统RGB三通道图像包含丰富的色彩信息,而单通道灰度图像仅保留亮度信息,这使得神经网络在特征提取阶段面临信息量不足的困境。YOLO-MIF网络通过三个关键创新点解决了这一难题:
1.1 伪多通道灰度图像生成技术
常规灰度图像处理方式简单粗暴——将单通道复制三份作为伪RGB输入。这种方法虽然兼容现有网络结构,但并未真正增加信息量。YOLO-MIF采用的策略更为精巧:
- 多尺度滤波处理:对原始灰度图像分别应用高斯滤波(σ=1.0)、拉普拉斯锐化(3×3核)和中值滤波(5×5窗口),生成三个处理版本
- 信息融合策略:将原始图像与三个处理结果堆叠为四通道输入,通道顺序为[原始, 高斯, 拉普拉斯, 中值]
- 通道注意力机制:在网络第一层后引入SE模块,自动学习各通道的权重分配
这种处理方式的优势在于:
- 高斯滤波版本提供平滑特征,抑制高频噪声
- 拉普拉斯版本增强边缘信息,补偿灰度图像缺失的色差边缘
- 中值滤波有效处理离焦模糊常见的椒盐噪声
实际测试表明,四通道输入比传统三通道复制方式在NEU-DET数据集上提升mAP约0.7%,而计算开销仅增加5%
1.2 网络结构重参数化技术
YOLO-MIF的核心创新是C3k2_WDBB模块,其设计哲学源于经典的RepVGG思想,但在实现上有重要改进:
python复制class C3k2_WDBB(nn.Module):
def __init__(self, c1, c2, n=1, shortcut=True, g=1, e=0.5):
super().__init__()
# 训练时结构
self.cv1 = Conv(c1, c2, 1, 1)
self.cv2 = Conv(c1, c2, 1, 1)
self.cv3 = Conv(c1, c2, 3, 1)
self.cv4 = Conv(c2, c2, 3, 1, g=g)
self.bn = nn.BatchNorm2d(c2 * 3)
self.act = nn.
