Skip to main content
QUICK REVIEW

[論文レビュー] Embedded Implementation of a Deep Learning Smile Detector

Pedram Ghazi, Antti P. Happonen|arXiv (Cornell University)|Jul 10, 2018
Speech and Audio Processing被引用数 4
ひとこと要約

本稿では、非同期マルチスレーディングを用いて処理パイプラインを並列化することで、NVIDIA Jetson TX2 プラットフォーム上に実装されたリアルタイム埋め込み型ディープラーニングスミル検出器を提示する。軽量な MobileNet アーキテクチャが、GENKI-4K で 93.6% の近似最先端の正確性を達成し、計算コストを著しく低減した(27.3 FPS で処理)ことが示された。これは、エッジデプロイ用に、VGG16 よりも高速で正確なトレードオフを実現している。

ABSTRACT

In this paper we study the real time deployment of deep learning algorithms in low resource computational environments. As the use case, we compare the accuracy and speed of neural networks for smile detection using different neural network architectures and their system level implementation on NVidia Jetson embedded platform. We also propose an asynchronous multithreading scheme for parallelizing the pipeline. Within this framework, we experimentally compare thirteen widely used network topologies. The experiments show that low complexity architectures can achieve almost equal performance as larger ones, with a fraction of computation required.

研究の動機と目的

  • 低リソースの埋め込みプラットフォーム上で、ディープラーニングベースのスミル検出をリアルタイムで実装すること。
  • Jetson TX2 プラットフォーム上で、13 種類のディープニューラルネットワークアーキテクチャのシステムレベルの文脈におけるスピード/正確性トレードオフを評価すること。
  • ストリーミング画像データ用に効率的なパイプライン並列化を可能にする非同期マルチスレーディングソフトウェアアーキテクチャの設計および実装すること。
  • CPU、GPU、および埋め込みGPU(Jetson TX2)におけるエンドツーエンドのスミル検出パイプラインのシステムレベルのパフォーマンスを比較すること。
  • 軽量モデル(例:MobileNet)が、計算負荷を著しく低減することでエッジデバイスでのリアルタイム動作を可能にし、近似最先端の正確性を達成できることを実証すること。

提案手法

  • システムは、フレーム取得、顔領域検出(Viola-Jones を用いて)、スミル検出(事前学習済みのCNNを用いて)、可視化の各処理を専用スレッドで実行する非同期マルチスレーディングアーキテクチャを採用している。
  • スミル検出の評価として、VGG16、MobileNet、ShuffleNet などを含む13種類の広く使われているディープニューラルネットワークアーキテクチャを、GENKI-4K および CelebA データセット上で検証した。
  • スミル検出パイプラインは、CPU 上で実行される Viola-Jones 顔検出器と、GPU 上で実行されるディープCNNを統合し、スレッドセーフなキューを介してデータフローを管理している。
  • パフォーマンスは、フレーム/秒(FPS)、推論時間、モデルサイズ、浮動小数点演算数(FLOPs)の観点から測定され、正確性は正確度(ACC)およびAUCで評価された。
  • ソフトウェアスタックは、6コアのARM CPU と 256 CUDA コアGPUを備えた、非均質な埋め込みプラットフォームであるNVIDIA Jetson TX2 にデプロイされ、デスクトップCPUおよびGPUシステムと比較された。
  • システムはJetsonプラットフォームのGPUを活用して並列推論を実現し、年齢や性別などの追加検出タスクの統合を可能にするモジュラー設計を採用している。

実験結果

リサーチクエスチョン

  • RQ1軽量なディープニューラルネットワークアーキテクチャは、VGG16 よりも大きなモデルと同等のスミル検出正確性を達成しながら、埋め込みプラットフォーム上でリアルタイムで動作可能か?
  • RQ2NVIDIA Jetson TX2 プラットフォームにデプロイされた場合、さまざまなCNNアーキテクチャのシステムレベルのパフォーマンス(スピード、正確性、メモリ使用量)はどのようになるか?
  • RQ3提案された非同期マルチスレーディングパイプラインアーキテクチャは、同期的またはモノリシックな設計と比較して、ストリーミング画像処理システムにおけるスループットとレイテンシをどの程度改善するか?
  • RQ4モデルの複雑さとFLOP数は、埋め込みスミル検出システムにおける推論スピードと正確性とどの程度相関するか?
  • RQ5軽量モデルを用いたシステムレベルの実装は、処理スピードを向上させつつ、妥当な正確性を維持できるか、最先端の検出器を上回る性能を示せるか?

主な発見

  • α=1、ρ=1 の MobileNet アーキテクチャは、GENKI-4K データセットで 93.6% の正確度を達成し、最先端の SmileNet(95.76%)に非常に近い性能を示したが、計算量は著しく低減された。
  • 提案されたシステムは、Jetson TX2 プラットフォーム上で平均 27.3 フレーム/秒の処理速度を達成し、動画ストリームのリアルタイム要件を満たした。
  • VGG16 は、MobileNet よりもフレームあたり約 750 倍の浮動小数点演算を必要としたが、正確度の向上はわずかであり、埋め込みデプロイには不適切であった。
  • デスクトップGPU上のシステムレベルのパイプラインは、40–60 FPS の処理速度を達成し、同じデータセットで報告された 21.15 FPS の SmileNet よりも優れていた。これは、より単純な顔検出器を使用しているにもかかわらずである。
  • Jetson TX2 上での Viola-Jones 顔検出器とCNNベースのスミル検出器の統合により、リアルタイム動作が実現可能となった。スミル検出コンponentが主なパフォーマンスボトルネックであった。
  • 本研究は、埋め込みシステムにおいて、MobileNetベースのモデルが正確性と計算効率の最良のトレードオフを提供することを確認した。一方、VGG16 などの大規模モデルは、メモリおよびレイテンシ制約のため、不適切であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。