[论文解读] Real-time Mask Detection on Google Edge TPU
本文提出了一种轻量级、实时的口罩检测系统,基于MobileNetV2-SSD架构,并采用训练后量化技术,在Google Edge TPU上部署。该模型在Edge TPU上的推理延迟为6.4ms,mAP达到58.4%,在与浮点模型相比精度损失可忽略的前提下,实现了低延迟、保护隐私的边缘设备部署。
After the COVID-19 outbreak, it has become important to automatically detect whether people are wearing masks in order to reduce risk of front-line workers. In addition, processing user data locally is a great way to address both privacy and network bandwidth issues. In this paper, we present a light-weighted model for detecting whether people in a particular area wear masks, which can also be deployed on Coral Dev Board, a commercially available development board containing Google Edge TPU. Our approach combines the object detecting network based on MobileNetV2 plus SSD and the quantization scheme for integer-only hardware. As a result, the lighter model in the Edge TPU has a significantly lower latency which is more appropriate for real-time execution while maintaining accuracy comparable to a floating point device.
研究动机与目标
- 开发一种适用于公共场所实际部署的低延迟、保护隐私的口罩检测系统。
- 通过在边缘设备上本地处理数据,而非将视频传输至云端,解决隐私和带宽问题。
- 在保持高精度的同时,减小模型大小并降低推理延迟,以适用于Coral Dev Board等低功耗硬件。
- 证明在Edge TPU上仅使用整数推理的量化模型可实现与浮点模型相当的性能。
提出的方法
- 该模型采用单阶段目标检测架构,结合MobileNetV2作为主干网络,SSD用于预测边界框和类别得分。
- 通过使用TensorFlow Model Zoo中预训练的面部检测模型进行权重初始化,并针对口罩/无口罩分类进行微调,实现迁移学习。
- 应用训练后量化,将32位浮点模型转换为适用于Edge TPU部署的8位整数模型。
- 使用Edge TPU编译器对模型进行编译,以进一步优化推理速度。
- 评估了两种模型变体:两阶段2NN模型(先检测面部,再分类)和统一的1NN模型(将两项任务整合为单个网络)。
- 在包含多种口罩颜色和增强面部-口罩组合的425张图像测试集上,在CPU和Edge TPU平台上进行评估。
实验结果
研究问题
- RQ1能否在Coral Dev Board等低功耗边缘硬件上有效部署轻量级、实时的口罩检测模型?
- RQ2在仅支持整数运算的硬件上,训练后量化对口罩检测模型的精度和延迟有何影响?
- RQ3在Edge TPU上,浮点模型与量化模型在mAP和推理延迟方面存在多大性能差距?
- RQ4对于实时口罩检测,统一的1NN模型是否在速度和精度上均优于两阶段的2NN模型?
- RQ5在公共监控应用中,本地设备上的推理在多大程度上可减少隐私和带宽问题?
主要发现
- 1NN模型在Edge TPU上的平均推理延迟为6.4ms,相比2NN模型的26ms延迟降低了90%。
- 1NN模型在Edge TPU上的mAP达到58.4%,相比32位浮点CPU模型(64.7%)仅下降0.4%,相比8位CPU模型(58.8%)下降6.3%。
- 1NN模型在延迟和精度上均优于2NN模型:CPU上延迟为455ms(2NN为1267ms),mAP为58.8%(2NN为55.0%)。
- 量化显著减小了模型大小并降低了延迟,1NN模型在CPU上延迟为455ms,在Edge TPU上为6.4ms,证明其在仅支持整数运算的硬件上具有优异效率。
- 1NN模型在Edge TPU上的版本保持了58.4%的mAP,与32位CPU版本相比仅损失0.4%精度,证明量化模型在边缘设备上的可行性。
- 统一的1NN架构比两阶段的2NN方法更高效,因为它消除了顺序推理的需要,显著降低了整体延迟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。