Skip to main content
QUICK REVIEW

[论文解读] Real-time Face Mask Detection in Video Data

Yuchen Ding, Zichen Li|arXiv (Cornell University)|May 5, 2021
Face recognition and analysis参考文献 2被引用 12
一句话总结

本文提出两种基于深度学习的实时口罩检测流水线:一种是结合预训练人脸检测器与合成数据分类器的两阶段方法,另一种是使用单阶段目标检测器(YOLO)在真实世界图像上微调的方案。基于YOLO的流水线在真实视频流中实现了89% mAP(0.5)和52 FPS的性能,展现出高效率与强鲁棒性,适用于监控系统中的实际部署。

ABSTRACT

In response to the ongoing COVID-19 pandemic, we present a robust deep learning pipeline that is capable of identifying correct and incorrect mask-wearing from real-time video streams. To accomplish this goal, we devised two separate approaches and evaluated their performance and run-time efficiency. The first approach leverages a pre-trained face detector in combination with a mask-wearing image classifier trained on a large-scale synthetic dataset. The second approach utilizes a state-of-the-art object detection network to perform localization and classification of faces in one shot, fine-tuned on a small set of labeled real-world images. The first pipeline achieved a test accuracy of 99.97% on the synthetic dataset and maintained 6 FPS running on video data. The second pipeline achieved a mAP(0.5) of 89% on real-world images while sustaining 52 FPS on video data. We have concluded that if a larger dataset with bounding-box labels can be curated, this task is best suited using object detection architectures such as YOLO and SSD due to their superior inference speed and satisfactory performance on key evaluation metrics.

研究动机与目标

  • 开发一种用于在新冠疫情背景下实时检测视频流中口罩正确与错误佩戴情况的系统。
  • 评估口罩检测流水线中准确率与推理速度之间的权衡。
  • 比较两种不同的深度学习方法:两阶段人脸检测器+分类器流水线与单阶段目标检测流水线。
  • 评估使用合成数据与小规模真实世界数据集在口罩检测中的可行性与性能表现。
  • 探讨自动化口罩检测系统在偏见、安全性及实际部署风险方面的长期影响。

提出的方法

  • 使用MTCNN作为预训练人脸检测器,从视频帧中提取人脸区域。
  • 在包含180,000张图像的合成数据集上训练口罩佩戴图像分类器,类别包括:正确佩戴、错误佩戴和无口罩。
  • 使用YOLOv5作为单阶段目标检测器,在包含14,233张带有人脸边界框和口罩佩戴标签的真实世界数据集上进行微调。
  • 应用知识蒸馏技术以提升模型准确率与效率,包括噪声教师模型与自学习方法。
  • 采用标准指标评估模型性能:测试准确率、mAP(0.5)以及用于实时推理的每秒帧数(FPS)。
  • 探索对抗鲁棒性与安全问题,包括通过蒸馏实现模型加固以及潜在的攻击向量。

实验结果

研究问题

  • RQ1使用预训练人脸检测器与合成数据分类器的两阶段流水线是否能在口罩检测中实现高准确率与实时性能?
  • RQ2在真实世界视频数据上,YOLO等单阶段目标检测模型相较于两阶段流水线在mAP与推理速度方面的表现如何?
  • RQ3知识蒸馏在不牺牲推理速度的前提下,能在多大程度上提升轻量化模型的准确率?
  • RQ4在公共监控中部署自动化口罩检测系统时,其关键风险与伦理问题是什么?
  • RQ5在真实世界部署场景中,如何通过增强模型对抗攻击与数据投毒的鲁棒性?

主要发现

  • 两阶段流水线在合成数据集上实现了99.97%的测试准确率,并在真实视频流中保持了6 FPS的处理速度。
  • 单阶段YOLO流水线在真实世界图像上实现了89% mAP(0.5)的性能,同时维持52 FPS,展现出优异的实时性能。
  • 知识蒸馏显著提升了模型准确率,其中一项实验显示,通过迭代蒸馏技术,小样本上的准确率从37%跃升至96.5%。
  • 研究结论指出,当拥有更大规模标注数据集时,YOLO和SSD等目标检测架构更适合该任务,因其具备更优的速度与性能表现。
  • 识别出安全风险,包括对抗攻击与数据隐私泄露,强调需通过模型加固与访问控制等策略加以缓解。
  • 强调在真实世界部署前,必须开展偏差评估与人口统计公平性测试,以防止产生歧视性结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。