Skip to main content
QUICK REVIEW

[論文レビュー] Training of SSD(Single Shot Detector) for Facial Detection using Nvidia Jetson Nano

Saif Ur Rehman, Muhammad Rashid Razzaq|arXiv (Cornell University)|May 28, 2021
COVID-19 diagnosis using AI被引用数 5
ひとこと要約

この論文では、MobileNetV2バックボーンを搭載したSSD(ワンショット検出器)を用いた軽量な顔検出システムを提示している。PyTorchを用いて139枚の画像データセットで訓練し、NVIDIA Jetson Nanoにデプロイした。モデルは2時間未満の訓練で約97%の精度を達成し、TensorRT最適化を活用することでエッジデバイス上で高速かつ高精度な推論を実現し、リアルタイム性能を発揮した。

ABSTRACT

In this project, we have used the computer vision algorithm SSD (Single Shot detector) computer vision algorithm and trained this algorithm from the dataset which consists of 139 Pictures. Images were labeled using Intel CVAT (Computer Vision Annotation Tool) We trained this model for facial detection. We have deployed our trained model and software in the Nvidia Jetson Nano Developer kit. Model code is written in Pytorch's deep learning framework. The programming language used is Python.

研究の動機と目的

  • エッジデプロイに適したリアルタイム顔検出システムの開発。
  • 139枚の顔画像からなる小規模でカスタムのデータセット上で軽量なSSDモデルを訓練すること。
  • リソース制約のあるNVIDIA Jetson Nanoプラットフォーム上でモデルをデプロイおよび最適化すること。
  • PyTorchおよびTensorRTを用いたSSDモデルの推論性能と精度を評価すること。
  • 最小限のデータとエッジハードウェアを用いた実世界の顔検出の実現可能性を示すこと。

提案手法

  • 139枚のラベル付き顔画像からなるカスタムデータセットを用いて、PyTorchでMobileNetV2バックボーンを搭載したSSDモデルを訓練した。
  • 画像のアノテーションにはIntel CVATを使用し、3つのクラス(Saif、Hadi、Rashid)とデフォルトのバックグラウンドクラスを設定した。
  • 訓練には5エポック、1エポックあたり2イテレーションを設定し、バックボーンおよび追加層のベース学習率を0.01とした。
  • NVIDIA TensorRTを用いて推論パイプラインを最適化し、Jetson Nanoでの推論を高速化した。
  • Dockerコンテナ内でJetson Nanoにモデルをデプロイし、A4Techウェブカメラを介してリアルタイムの動画入力を取得した。
  • オブジェクト検出と分類の両方を1回の順伝播処理で実行し、マルチスケールオブジェクト予測のためのマルチボックス技術を活用した。

実験結果

リサーチクエスチョン

  • RQ1139枚のカスタムデータセットで、MobileNetV2を搭載したSSDを用いた顔検出が効果的に可能かどうか。
  • RQ2Jetson NanoにTensorRT最適化を施した状態でデプロイされた場合、SSDの精度と推論速度はどの程度の性能を示すか。
  • RQ3ハイパーパramータ設定(例:学習率、エポック数)が、低データ環境下でのモデル収束と性能に与える影響は何か。
  • RQ4Jetson Nanoのようなエッジハードウェア上で、最小限の訓練時間で高い精度を達成できるか。
  • RQ5PyTorch、CVAT、TensorRTの統合は、組み込みシステムにおけるエンドツーエンドの顔検出にどの程度効果的か。

主な発見

  • 訓練済みのSSDモデルは、テストセットで約97%の精度を達成し、データセットサイズが小さいにもかかわらず優れた性能を示した。
  • Jetson Nanoのフルコンピュータ性能を活用して、約2時間で訓練が完了した。
  • モデルは正常にデプロイされ、A4Techウェブカメラを介して30fpsの動画を低遅延で取得し、リアルタイムで動作した。
  • TensorRTの使用により推論が顕著に高速化され、GPUアクセラレーションを備えたJetson Nano上でリアルタイム性能を実現した。
  • 110枚の学習画像と29枚の検証画像という少数のデータでも、SSDアーキテクチャにMobileNetV2バックボーンを組み合わせた手法が顔検出に有効であることが示された。
  • CVATによるアノテーションとDockerによるコンテナ化デプロイの統合により、エッジAIデプロイのためのスムーズで再現可能なパイプラインが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。