1. 项目背景与核心需求
2020年全球公共卫生事件爆发后,口罩佩戴检测技术从单纯的学术研究快速演变为具有实际社会价值的应用场景。作为计算机视觉领域的一个典型目标检测任务,行人口罩佩戴检测系统需要解决三个核心问题:
- 实时性:在公共场所的监控视频流中实现毫秒级响应
- 准确性:区分正确佩戴、错误佩戴(如露出鼻子)和未佩戴三种状态
- 鲁棒性:适应不同光照条件、遮挡情况和人脸角度
这个毕业设计项目的技术难点在于,传统基于Haar特征或HOG+SVM的方法在复杂场景下准确率不足,而纯端到端的深度学习方法又面临边缘设备部署的挑战。我在实际开发中发现,采用轻量级CNN+注意力机制的混合架构,能在ResNet50级别的模型上实现98.7%的测试准确率,同时满足树莓派等嵌入式设备的推理速度要求。
关键认知:口罩检测不是简单的人脸检测+区域分类,鼻梁区域的遮挡判断、下巴部位的覆盖检测都需要特殊的网络结构设计
2. 技术方案选型与对比
2.1 主流模型架构对比
通过对比实验验证了不同方案的性能表现(测试集包含5000张标注图像):
| 模型类型 | 准确率 | FPS(1080Ti) | 参数量 | 适用场景 |
|---|---|---|---|---|
| YOLOv5s | 96.2% | 120 | 7.2M | 高算力服务器 |
| MobileNetV3+SSD | 94.8% | 65 | 3.4M | 移动端部署 |
| 自研轻量CNN | 98.1% | 48 | 2.1M | 嵌入式设备 |
| ResNet50+FPN | 98.7% | 35 | 25.5M | 高精度要求场景 |
2.2 关键组件设计
- 注意力机制改进:
- 在Backbone末端添加CBAM模块(Convolutional Block Attention Module)
- 通道注意力权重计算公式:$M_c(F) = \sigma(ML
