Skip to main content
QUICK REVIEW

[論文レビュー] An FPGA-Accelerated Design for Deep Learning Pedestrian Detection in Self-Driving Vehicles

Abdallah Moussawi, Kamal Al Haddad|arXiv (Cornell University)|Sep 16, 2018
Advanced Neural Network Applications参考文献 16被引用数 4
ひとこと要約

本論文では、自律走行車両におけるリアルタイム歩行者検出のためのFPGAアクセラレートド Single Shot MultiBox Detector (SSD) を提案する。ベースラインSSDに比べて推論速度を4倍に向上させつつ、最先端の誤検出率性能を維持した。本手法は、ハイパラメータチューニングと16ビット固定小数点量子化を組み合わせ、Altera Arria 10 FPGAに最適化されたSSDを実装し、GPU上で24 FPSを達成した。これは、安全を最優先とする自律走行システムに不可欠な低遅延・高精度の歩行者検出を実現する。

ABSTRACT

With the rise of self-driving vehicles comes the risk of accidents and the need for higher safety, and protection for pedestrian detection in the following scenarios: imminent crashes, thus the car should crash into an object and avoid the pedestrian, and in the case of road intersections, where it is important for the car to stop when pedestrians are crossing. Currently, a special topology of deep neural networks called Fused Deep Neural Network (F-DNN) is considered to be the state of the art in pedestrian detection, as it has the lowest miss rate, yet it is very slow. Therefore, acceleration is needed to speed up the performance. This project proposes two contributions to address this problem, by using a deep neural network used for object detection, called Single Shot Multi-Box Detector (SSD). The first contribution is training and tuning the hyperparameters of SSD to improve pedestrian detection. The second contribution is a new FPGA design for accelerating the model on the Altera Arria 10 platform. The final system will be used in self-driving vehicles in real-time. Preliminary results of the improved SSD shows 3% higher miss-rate than F-DNN on Caltech pedestrian detection benchmark, but 4x performance improvement. The acceleration design is expected to achieve an additional performance improvement significantly outweighing the minimal difference in accuracy.

研究の動機と目的

  • 事故を防止し、安全性を向上させるために、自律走行車両におけるリアルタイムで高精度な歩行者検出のニーズに対応する。
  • 誤検出率は低いがリアルタイム用途に不適切なほど遅い最新鋭の統合深層ニューラルネットワーク(F-DNN)の性能ボトルネックを克服する。
  • ハイパラメータチューニングと量子化を用いてSingle Shot MultiBox Detector (SSD) を最適化し、検出精度と効率性を向上させる。
  • Altera Arria 10 プラットフォームを対象としたFPGAベースのアクセラレータを設計・実装し、自律走行車両への展開に適した低遅延・高効率な推論を実現する。

提案手法

  • Caltech、ETH、TUD-Brusselsの歩行者データセットを用いてSSDを訓練・微調整し、検出の特異性を向上させるために『person』のアノテーションに限定した。
  • 歩行者のサイズと形状の分布に適合させるために、con4_3層で3つのスケール(4%、7%、8.5%)と1つのアスペクト比(0.41)を選択することで、SSDのハイパラメータを最適化した。
  • Ristrettoを用いて16ビット固定小数点量子化を適用し、モデルの精度を低下させずに精度を低下させつつ、各層ごとの動的範囲分析を100枚のテスト画像に対して実施した。
  • VOCおよびCOCOデータセットで事前学習されたSSDモデルからの転移学習を実施し、収束性と検出精度を向上させた。
  • 最適化されたSSDモデルの推論を高速化するため、Altera Arria 10 プラットフォームを対象としたFPGAアクセラレータを設計した。
  • 標準的な指標を用いてCaltechベンチマーク上でモデルの性能を評価した:全体的および合理的な歩行者状況における誤検出率。

実験結果

リサーチクエスチョン

  • RQ1SSDのハイパラメータチューニングは、Caltech歩行者検出ベンチマークで誤検出率を著しく低減させつつ、高い推論速度を維持できるか?

主な発見

  • 最適化されたSSDモデルは、全体の歩行者検出ベンチマークで11.88%の誤検出率を達成し、デフォルトのSSD設定に比べて4.16%の改善を示した。
  • NVIDIA GTX Titan X GPU上で24 FPSを達成した。これは、Caltechデータセットにおいて報告された中で最も高速な最新鋭のSSDベースモデルである。
  • 16ビット固定小数点量子化後、誤検出率はわずか0.01%上昇(11.89%)にとどまり、量子化による精度損失が最小限であることが示された。
  • FPGAベースのアクセラレーション設計は、GPU推論に比べて顕著な性能向上が見込まれ、自律走行車両システムにおけるリアルタイム制約を満たす可能性を有する。
  • 最終的なシステムは、高精度(11.88%誤検出率)と高スループット(24 FPS)を両立しており、F-DNNなど他のモデルに比べて速度面で優位でありながら、競争力のある精度を維持している。
  • モデル最適化とFPGAアクセラレーションの組み合わせにより、安全を最優先とする自律走行アプリケーションにおける実用的で低遅延のリアルタイム歩行者検出ソリューションが実現可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。