Skip to main content
QUICK REVIEW

[論文レビュー] DeepPicar: A Low-cost Deep Neural Network-based Autonomous Car

Michael Garrett Bechtel, Elise Mcellhiney|arXiv (Cornell University)|Dec 19, 2017
Advanced Neural Network Applications被引用数 15
ひとこと要約

DeepPicar は、モノクロカメラ入力からのエンドツーエンドステアリング制御を実現する 9 層の CNN を用いた、Raspberry Pi 3 ベースの低コスト自律走行車両プラットフォームであり、NVIDIA の DAVE-2 を再現している。リアルタイム推論を 20–100 Hz で複数の組み込みプラットフォームで実現したが、共有リソースの競合によって最大 11.6 倍の遅延が生じる可能性があることが判明した。メモリ帯域幅の制限はパフォーマンス隔離に有効である一方、キャッシュパーティショニングは効果を示さなかった。

ABSTRACT

We present DeepPicar, a low-cost deep neural network based autonomous car platform. DeepPicar is a small scale replication of a real self-driving car called DAVE-2 by NVIDIA. DAVE-2 uses a deep convolutional neural network (CNN), which takes images from a front-facing camera as input and produces car steering angles as output. DeepPicar uses the same network architecture---9 layers, 27 million connections and 250K parameters---and can drive itself in real-time using a web camera and a Raspberry Pi 3 quad-core platform. Using DeepPicar, we analyze the Pi 3's computing capabilities to support end-to-end deep learning based real-time control of autonomous vehicles. We also systematically compare other contemporary embedded computing platforms using the DeepPicar's CNN-based real-time control workload. We find that all tested platforms, including the Pi 3, are capable of supporting the CNN-based real-time control, from 20 Hz up to 100 Hz, depending on hardware platform. However, we find that shared resource contention remains an important issue that must be considered in applying CNN models on shared memory based embedded computing platforms; we observe up to 11.6X execution time increase in the CNN based control loop due to shared resource contention. To protect the CNN workload, we also evaluate state-of-the-art cache partitioning and memory bandwidth throttling techniques on the Pi 3. We find that cache partitioning is ineffective, while memory bandwidth throttling is an effective solution.

研究の動機と目的

  • リアルタイムの深層学習に基づく自律走行車両制御のための低コストでアクセス可能なテストベッドの開発。
  • Raspberry Pi 3 を含む組み込みプラットフォームにおける CNN ベース制御システムのリアルタイム推論性能の評価。
  • 統合ワークロードにおける共有リソース競合(キャッシュおよび DRAM)が CNN 推論遅延に与える影響の調査。
  • リアルタイム CNN 推論パフォーマンスを保護するための共有リソース隔離技術(キャッシュパーティショニングおよびメモリ帯域幅の制限)の有効性の評価。
  • 今後の研究において、リソース制限のあるプラットフォームに圧縮または量子化された CNN を効率的にデプロイ可能かどうかの検討。

提案手法

  • モノクロカメラ入力からのエンドツーエンドステアリング予測のため、NVIDIA の DAVE-2 CNN アーキテクチャ(9 層、27M 接続、250K パラメータ)を再現。
  • Web カメラおよび RC 車両のフレームワークを用いて、Raspberry Pi 3 を使用し、低コストでリアルタイム自律制御システムを構築。
  • Raspberry Pi 3 やより高性能な代替機器を含む複数の組み込みプラットフォームで、20–100 Hz のリアルタイム推論を実行。
  • 同じプラットフォーム上で複数の同時実行 CNN モデルおよびタスクを実行することで、共有リソース競合によるパフォーマンス劣化を測定。
  • 最先端の隔離技術(キャッシュパーティショニングおよびメモリ帯域幅の制限)を適用し、リアルタイムパフォーマンスの維持における有効性を評価。
  • 制御されたベンチマークおよびワークロード統合実験を通じて、ハードウェアレベルのリソース競合および隔離メカニズムの影響を評価。

実験結果

リサーチクエスチョン

  • RQ1Raspberry Pi 3 のような低コスト組み込みプラットフォームは、自律走行車両のリアルタイムエンドツーエンド深層学習ベース制御をサポートできるか?
  • RQ2統合された組み込みシステムにおける共有リソース競合(キャッシュおよび DRAM)は、CNN 推論ワークロードのパフォーマンスにどのように影響するか?
  • RQ3既存の共有リソース隔離技術(キャッシュパーティショニングおよびメモリ帯域幅の制限)は、リアルタイム CNN 推論パフォーマンスをどの程度保護できるか?
  • RQ4異なる組み込みコンピューティングプラットフォーム間で、CNN モデルの実現可能なリアルタイムパフォーマンス(推論周波数)はどの程度か?
  • RQ5リソース制限のあるプラットフォームは、将来的な低消費電力自律走行システムに向けた圧縮または量子化された CNN の効率的デプロイを可能にするか?

主な発見

  • Raspberry Pi 3 やその他の組み込みプラットフォームは、ハードウェアに応じて 20 Hz から 100 Hz のフレームレートを達成することで、リアルタイム CNN 推論を自律制御に活用可能である。
  • 専用 CPU コアを割り当てても、共有リソース競合により CNN 推論遅延が最大 11.6 倍にまで増加し、リアルタイムパフォーマンスが著しく劣化することが判明した。
  • 共有キャッシュ階層のため、キャッシュパーティショニングは CNN ワークロードの干渉からの隔離に効果を示さなかった。
  • メモリ帯域幅の制限は、リソース競合下でも CNN 推論パフォーマンスを保護する有効な技術であり、遅延の急増を顕著に低減した。
  • DeepPicar プラットフォームは、100 ドルの部品費で NVIDIA の DAVE-2 の動作を正確に再現でき、リアルタイム深層学習制御に関する低コストな研究を可能にした。
  • 本研究は、ハードウェアに配慮した最適化および隔離メカニズムが、組み込み自律走行システムにおける DNN の信頼性あるリアルタイムデプロイに不可欠であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。