1. 项目背景与核心价值
在目标检测领域,YOLO系列算法因其出色的实时性和准确性一直备受关注。SPPF(Spatial Pyramid Pooling Fast)模块作为YOLOv5/v6/v7等版本中的关键组件,通过多尺度特征融合显著提升了模型对不同尺寸目标的检测能力。然而,传统SPPF模块在处理时序数据或需要上下文感知的场景时,往往忽略了特征间的时空关联性。
我们提出的STFFM(Spatial-Temporal Feature Fusion Module)模块创新性地将时空特征融合机制引入SPPF结构,通过加强中间阶段特征的相互作用,在TGRS 2025遥感影像目标检测任务中实现了1.8%的mAP提升。这个改进特别适合处理视频流数据、卫星时序影像等具有时空连续性的检测场景。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 算法改进原理详解
2.1 SPPF模块的局限性分析
标准SPPF模块通过并行多个最大池化层(kernel size分别为5×5、9×9、13×13)来捕获不同感受野的特征,然后将各分支输出与原始特征进行拼接。这种设计存在两个明显缺陷:
- 空间孤立性:各尺度特征图独立处理,缺乏跨尺度的信息交互
- 时序割裂性:当处理视频序列时,当前帧特征无法有效利用历史帧的时空上下文
python复制# 传统SPPF实现(YOLOv5版本)
def SPPF(x):
x1 = MaxPool2d(5,1,2)(x)
x2 = MaxPool2d(9,1,4)(x1)
x3 = MaxPool2d(13,1,6)(x2)
return torch.cat([x,x1,x2,x3], dim=1)
2.2 STFFM模块设计思想
STFFM的核心创新在于引入时空特征交互机制:
-
时空注意力门控(ST-Attention Gate):
- 使用3D卷积处理时序维度(当输入为视频流时)
- 通过通道注意力(SE模块变体)动态调整各尺度特征权重
- 计算公式:$ATT = \sigma(Conv3D(f_{t-n:t})) \odot SE(f_t)$
-
特征循环交互(Feature Recursive Interaction):
- 建立跨尺度的
