1. 项目背景与核心需求
2020年全球公共卫生事件爆发后,口罩佩戴检测技术迅速成为计算机视觉领域的热门研究方向。作为计算机视觉与深度学习结合的典型应用场景,这项技术能够自动识别图像或视频中行人是否规范佩戴口罩,在公共场所防疫管理中具有重要实用价值。
我去年指导的本科毕业设计项目,正是基于深度学习实现了一套高精度的行人口罩佩戴检测系统。与传统的规则式图像处理方案相比,深度学习模型在复杂场景下的适应性和准确率表现更为突出。项目最终实现的模型在自建测试集上达到96.8%的mAP(mean Average Precision),能够稳定运行在普通消费级GPU设备上。
2. 技术方案选型与对比
2.1 主流目标检测模型对比
在技术选型阶段,我们重点对比了三大类目标检测框架:
-
Two-Stage检测器:
- 代表模型:Faster R-CNN、Mask R-CNN
- 优势:检测精度高
- 劣势:计算复杂度高,实时性较差
-
One-Stage检测器:
- 代表模型:YOLO系列、SSD
- 优势:推理速度快
- 劣势:小目标检测效果欠佳
-
Anchor-Free检测器:
- 代表模型:CenterNet、FCOS
- 优势:模型结构简单
- 劣势:训练难度较大
考虑到实际应用场景对实时性的要求,我们最终选择YOLOv5作为基础框架。其在速度和精度之间取得了较好的平衡,且社区生态完善,便于调试和优化。
2.2 模型改进方案
基于YOLOv5s(small版本)进行以下改进:
-
注意力机制引入:
- 在Backbone末端添加CBAM(Convolutional Block Attention Module)
- 使模型更关注人脸区域,减少背景干扰
-
Neck结构优化:
- 将原PANet替换为BiFPN
- 增强特征融合效果,提升小目标检测能力
-
损失函数改进:
- 使用Focal Loss替代原CrossEntropy Loss
- 缓解样本不平衡问题(戴口罩/不戴口罩样本比例不均)
3. 数据集构建与处理
3.1 数据来源与标注
我们构建
