Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Real-Time LiDAR 3D Object Detection on a Mobile Device

Pu Zhao, Wei Niu|arXiv (Cornell University)|Dec 26, 2020
Advanced Neural Network Applications参考文献 61被引用数 5
ひとこと要約

本稿では、モバイルデバイスにおけるリアルタイム3D LiDARオブジェクト検出を実現する、コンパイラに配慮した強化学習駆動の統合フレームワークを提案する。各レイヤーに対して動的に最適なカーネルサイズと pruning 戦略を選択することで、Samsung Galaxy S20で平均97msの推論時間と最先端の検出精度を達成した。これは、コンパイラ最適化された推論を備えたモバイルGPU上で初めてリアルタイム3D検出を実現した。

ABSTRACT

3D object detection is an important task, especially in the autonomous driving application domain. However, it is challenging to support the real-time performance with the limited computation and memory resources on edge-computing devices in self-driving cars. To achieve this, we propose a compiler-aware unified framework incorporating network enhancement and pruning search with the reinforcement learning techniques, to enable real-time inference of 3D object detection on the resource-limited edge-computing devices. Specifically, a generator Recurrent Neural Network (RNN) is employed to provide the unified scheme for both network enhancement and pruning search automatically, without human expertise and assistance. And the evaluated performance of the unified schemes can be fed back to train the generator RNN. The experimental results demonstrate that the proposed framework firstly achieves real-time 3D object detection on mobile devices (Samsung Galaxy S20 phone) with competitive detection performance.

研究の動機と目的

  • リソース制限のあるモバイルエッジデバイス(自動運転車両に使用されるスマートフォンを含む)でリアルタイム3Dオブジェクト検出を可能にすること。
  • 既存のDNN高速化フレームワークにおける固定されたpruning戦略や手動によるハイパーパramータチューニングの限界を克服すること。
  • 並列処理と実行効率を考慮した、コンパイラに配慮した最適化をニューラルアーキテクチャ探索プロセスに統合すること。
  • モバイルGPU上で厳密なリアルタイム推論制約(例:100ms未満)を満たしつつ、高い検出精度を達成すること。
  • 柔軟でレイヤー単位のネットワーク強化とpruningが、一様なpruning手法に比べて速度と精度の両面で優れていることを示すこと。

提案手法

  • 各レイヤーに対してネットワーク強化(例:カーネルサイズチューニング)とpruning(例:フィルタ、パターン、ブロックpruning)の両方を統合した探索空間を自動的に探索するため、ジェネレータRNNを用いる。
  • 検出mAPと推論速度のバランスを取る報酬関数を採用し、コンパイラ最適化されたコード生成からのフィードバックを活用することで、強化学習を実行する。
  • コンパイラに配慮したコード生成により、Winograd変換やタイリングなどの最適化下での実際の推論速度を評価し、探索中に現実的な性能推定が可能になる。
  • 高次元探索空間を効率的に探索するため、ジェネレータRNNの学習を高速化するためにベイジアン最適化(BO)を適用する。
  • 探索空間にはカーネルサイズの調整と複数のpruningタイプが含まれており、レイヤーごとの最適化戦略を可能にする。
  • フレームワークは、KITTIデータセットを用いたPointPillarsベースの3D検出モデルを対象とし、推論はSamsung Galaxy S20のモバイルGPU上で測定した。

実験結果

リサーチクエスチョン

  • RQ1コンパイラに配慮した統合フレームワークは、モバイルGPU上でネットワーク強化とpruningを同時に最適化し、リアルタイム3Dオブジェクト検出を達成できるか?
  • RQ2レイヤー単位の柔軟なpruningとカーネルサイズチューニングは、一様なpruning戦略に比べて速度と精度の両面で優れているか?
  • RQ3コンパイラ最適化されたフィードバックを用いた強化学習は、高性能で低遅延なモデルの探索を効果的に導けるか?
  • RQ4カーネルサイズチューニングとWinograd変換は、モバイルエッジデバイスでの推論速度をどの程度向上させるか?
  • RQ5本手法は、モバイルハードウェア上でのリアルタイム性能と精度の面で、最先端の3D検出モデルと比較してどのように差をつけるか?

主な発見

  • 提案フレームワークは、Samsung Galaxy S20のモバイルGPU上で平均97msの推論時間を達成し、リアルタイム要件(100ms未満)を満たしている。
  • KITTIデータセットでは76.38%のmAPを達成し、元のPointPillarsモデル(エイジリスセットで84.05% mAP)や他のpruningベースラインを上回っている。
  • 86%のpruning比の下で、本手法はフィルタpruning(74.89% mAP)やパターンpruning(73.77% mAP)よりも優れた検出性能を示した。
  • サーバーGPU(GTX 1080Ti)上では18msの推論時間を達成し、非PointPillarベースの手法に比べて少なくとも2.7倍速く、競争力のある精度を維持している。
  • リアルタイム制約を90msに厳しくした場合でも、74.15%のmAPを維持し、平均推定速度が89msであったため、より厳しい遅延制約に対しても耐性があることが示された。
  • 本フレームワークは、多数の既存手法が非対応または最適化不能なレイヤー(例:3Dスパース畳み込み)に依存している中、コンパイラ最適化を完全に備えたモバイルGPU上で初めてリアルタイム3Dオブジェクト検出をサポートした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。