Skip to main content
QUICK REVIEW

[論文レビュー] LMNet: Real-time Multiclass Object Detection on CPU using 3D LiDAR

Kazuki Minemura, Hengfui Liau|arXiv (Cornell University)|May 13, 2018
Advanced Neural Network Applications参考文献 21被引用数 9
ひとこと要約

LMNet は、CPU 上でリアルタイムに動作する単一段階の 3D 物体検出ネットワークであり、LiDAR ポイントクラウドのみを用いて車両、歩行者、自転車を検出する。拡張畳み込みとマルチビュー・ポイントクラウド投影を採用し、GPU では最大 50 FPS、Intel Core i5 CPU では 10 FPS を達成し、一般用途の CPU でも実用的な自律走行システムに適している。モデルとコードはオープンソース化されている。

ABSTRACT

This paper describes an optimized single-stage deep convolutional neural network to detect objects in urban environments, using nothing more than point cloud data. This feature enables our method to work regardless the time of the day and the lighting conditions.The proposed network structure employs dilated convolutions to gradually increase the perceptive field as depth increases, this helps to reduce the computation time by about 30%. The network input consists of five perspective representations of the unorganized point cloud data. The network outputs an objectness map and the bounding box offset values for each point. Our experiments showed that using reflection, range, and the position on each of the three axes helped to improve the location and orientation of the output bounding box. We carried out quantitative evaluations with the help of the KITTI dataset evaluation server. It achieved the fastest processing speed among the other contenders, making it suitable for real-time applications. We implemented and tested it on a real vehicle with a Velodyne HDL-64 mounted on top of it. We achieved execution times as fast as 50 FPS using desktop GPUs, and up to 10 FPS on a single Intel Core i5 CPU. The deploy implementation is open-sourced and it can be found as a feature branch inside the autonomous driving framework Autoware. Code is available at: https://github.com/CPFL/Autoware/tree/feature/cnn_lidar_detection

研究の動機と目的

  • 一般用途の CPU にデプロイ可能な、LiDAR ポイントクラウド データのみを用いたリアルタイムで多クラス 3D 物体検出システムの開発。
  • 検出精度を損なわずに高い推論速度を達成し、自律走行システムでのリアルタイム性能を実現すること。
  • マルチビュー投影と拡張畳み込みを用いて 3D ポイントクラウドを処理する、軽量で単一段階の CNN アーキテクチャの設計。
  • Velodyne HDL-64E LiDAR を搭載した実車上でのネットワークの実装と検証。
  • 研究および実用化のため、事前学習済みモデルと推論コードをオープンソース化すること。

提案手法

  • ネットワークは、非整理なポイントクラウドの五チャンネル入力表現(距離、反射率、および x, y, z 座標)を、2次元のパースペクティブ・ビューに投影する。
  • 拡張率が段階的に増加する(1, 1, 2, 4, 8, 16, 32)独自の拡張畳み込み層スタックを用い、受容 field を段階的に拡大するとともに計算量を削減する。
  • 各ポイントに対して物体存在確率マップと 3D バウンディングボックスのオフセット予測を出力し、ポイント単位の分類と回帰を可能にする。
  • 一般化を向上させ、過学習を低減するために、トレーニング段階でドロップアウト戦略とデータ拡張が適用される。
  • Intel MKL を介して Intel CPU 向けに最適化された Caffe フォークを用いて実装され、一般用途のハードウェアでも効率的な推論が可能になる。
  • 入力前処理には PCL および OpenCV を用いたポイントクラウドの投影が行われ、出力は非最大抑制による後処理を経て最終的な検出結果が生成される。
Figure 1: LMNet architecture
Figure 1: LMNet architecture

実験結果

リサーチクエスチョン

  • RQ1一般用途の CPU 上で、LiDAR ポイントクラウド データのみを用いた単一段階の CNN が、リアルタイムに 3D 多クラス物体検出を達成できるか?
  • RQ2拡張畳み込みアーキテクチャは、精度を損なわず、3D 物体検出における推論速度と受容 field のカバー範囲をどのように向上させるか?
  • RQ3KITTI データセットのようなベンチマークデータセットと比較して、実世界データにおけるモデルの性能はいかがなっているか?
  • RQ4一般消費者向けハードウェア上で 30ms 未満の推論時間を達成しつつ、高い検出精度を維持できるか?
  • RQ5マルチビュー入力エンコーディング(距離、反射率、空間座標)は、バウンディングボックスの局所化と方向予測にどのように影響を与えるか?

主な発見

  • LMNet は、GTX 1080 GPU 上で 50 FPS、Intel Core i5-6600K CPU 上で 10 FPS の推論速度を達成し、一般用途のハードウェアでもリアルタイム性能を実証した。
  • KITTI データセットにおける中程度設定下での 3D 検出で、車両は 15.24%、歩行者 11.46%、自転車 3.23% の平均適合度を達成した。
  • 拡張畳み込みの導入により、受容 field を最大 127×127 まで拡大し、標準畳み込みと比較して計算量を約 30% 減少させた。
  • Tesla P40 上では 147 FPS(6.8ms 推論時間)を達成し、他の最先端手法を上回る速度性能を示した。
  • Velodyne HDL-64E LiDAR を搭載した実車上でも、LMNet はリアルタイムに 3D 物体を正しく分類・検出でき、実装可能性が実証された。
  • Autoware でのオープンソース実装と事前学習済みモデルの提供により、研究分野における再現性と広範な採用が可能になった。
Figure 2: Encoded input point cloud
Figure 2: Encoded input point cloud

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。