Skip to main content
QUICK REVIEW

[論文レビュー] Real-time Mask Detection on Google Edge TPU

Keondo Park, Wonyoung Jang|arXiv (Cornell University)|Oct 9, 2020
Advanced Neural Network Applications参考文献 13被引用数 8
ひとこと要約

本論文では、MobileNetV2-SSDアーキテクチャを用い、トレーニング後量子化を適用することで、Google Edge TPUにデプロイされた軽量でリアルタイムなマスク検出システムを提示する。モデルはEdge TPU上で6.4msの推論遅延を達成しながらも、58.4%のmAPを維持しており、浮動小数点モデルと比較して顕著な精度損失がなく、プライバシーを守る低遅延のエッジデバイスへのデプロイを可能にする。

ABSTRACT

After the COVID-19 outbreak, it has become important to automatically detect whether people are wearing masks in order to reduce risk of front-line workers. In addition, processing user data locally is a great way to address both privacy and network bandwidth issues. In this paper, we present a light-weighted model for detecting whether people in a particular area wear masks, which can also be deployed on Coral Dev Board, a commercially available development board containing Google Edge TPU. Our approach combines the object detecting network based on MobileNetV2 plus SSD and the quantization scheme for integer-only hardware. As a result, the lighter model in the Edge TPU has a significantly lower latency which is more appropriate for real-time execution while maintaining accuracy comparable to a floating point device.

研究の動機と目的

  • 公共空間における実用的デプロイメントに適した低遅延でプライバシーを守るマスク検出システムの開発。
  • クラウドへの動画送信を避けることで、プライバシーや帯域幅の懸念を解決するため、データをエッジデバイスでローカルに処理する。
  • 低消費電力のハードウェア(例:Coral Dev Board)へのデプロイに適した、モデルサイズと推論遅延の低減を図りながらも、高い精度を維持する。
  • エッジTPU上で整数のみの推論が可能な量子化モデルが、浮動小数点モデルと同等の性能を達成できることを示す。

提案手法

  • モデルは、バックボーンとしてMobileNetV2を、境界ボックスとクラススコアの予測にSSDを組み合わせた単段階オブジェクト検出アーキテクチャを採用している。
  • 転移学習を適用し、TensorFlow Model Zooの事前学習済み顔検出モデルを初期化として用い、マスクあり/なし分類に微調整している。
  • トレーニング後量子化を適用して、32ビット浮動小数点モデルを8ビット整数のみのモデルに変換し、Edge TPUへのデプロイに適した形にしている。
  • 推論速度のさらなる最適化のため、Edge TPUコンパイラーを用いてモデルをコンパイルしている。
  • 2段階の2NNモデル(顔検出 → 分類)と1段階の統合1NNモデル(両タスクを1つのネットワークに統合)の2つのモデルバリアントを評価している。
  • テストセットとして425枚の画像(多様なマスクの色と変形を含む)を用い、CPUおよびEdge TPUプラットフォーム上で評価を実施している。

実験結果

リサーチクエスチョン

  • RQ1Coral Dev Boardのような低消費電力のエッジハードウェアに、軽量でリアルタイムなマスク検出モデルを効果的にデプロイできるか?
  • RQ2整数のみのハードウェア上で実行する際、トレーニング後量子化がマスク検出モデルの精度と遅延に与える影響は何か?
  • RQ3Edge TPU上で、浮動小数点モデルと量子化モデルの間でmAPと推論遅延の性能ギャップはどの程度か?
  • RQ4リアルタイムマスク検出において、統合1NNモデルは2段階の2NNモデルを上回る性能(速度と精度の両面で)を示せるか?
  • RQ5ローカルでのデバイス内推論は、公共監視アプリケーションにおけるプライバシーと帯域幅の懸念をどの程度軽減できるか?

主な発見

  • 1NNモデルはEdge TPU上で平均6.4msの推論遅延を達成し、2NNモデルの26msと比較して90%の遅延削減を実現した。
  • 1NNモデルはEdge TPU上で58.4%のmAPを達成し、32ビット浮動小数点CPUモデル(64.7%)と比較して0.4%の低下に抑えられ、8ビットCPUモデル(58.8%)と比較しても6.3%の低下にとどまった。
  • 1NNモデルは遅延と精度の両面で2NNモデルを上回り、CPU上での遅延は455ms(2NNの1267ms対比)、mAPは58.8%(2NNの55.0%対比)を達成した。
  • 量子化によりモデルサイズと遅延が顕著に削減され、1NNモデルはCPU上で455ms、Edge TPU上で6.4msの遅延を達成し、整数のみのハードウェア上で優れた効率性を示した。
  • 1NNモデルのEdge TPU版は58.4%のmAPを維持しており、32ビットCPUバージョンと比較してわずか0.4%の精度低下に抑えられ、量子化モデルがエッジデバイスで実用可能であることを裏付けた。
  • 統合1NNアーキテクチャは、2段階の2NNアプローチよりも効率的であり、逐次推論の必要性を排除し、総合的な遅延を低減している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。