Skip to main content
QUICK REVIEW

[論文レビュー] MVLidarNet: Real-Time Multi-Class Scene Understanding for Autonomous Driving Using Multiple Views

Ke Chen, Ryan Oldja|arXiv (Cornell University)|Jun 9, 2020
Advanced Neural Network Applications参考文献 23被引用数 7
ひとこと要約

MVLidarNet は、1つの LiDAR スキャンの透視図法的および上空図的投影を用いる2段階のマルチビュー深層学習システムであり、リアルタイムでの複数クラス物体検出(車両および歩行者)と走行可能領域のセグメンテーションを可能にする。エンコーダ・デコーダアーキテクチャを用いて透視図法的ビューでのセマンティックセグメンテーションと上空図的ビューでの物体検出を統合することで、150 fps の高速な推論を実現し、1フレームあたり100個以上の動的物体が存在する混雑したシーンにおいても高い精度を維持する。

ABSTRACT

Autonomous driving requires the inference of actionable information such as detecting and classifying objects, and determining the drivable space. To this end, we present Multi-View LidarNet (MVLidarNet), a two-stage deep neural network for multi-class object detection and drivable space segmentation using multiple views of a single LiDAR point cloud. The first stage processes the point cloud projected onto a perspective view in order to semantically segment the scene. The second stage then processes the point cloud (along with semantic labels from the first stage) projected onto a bird's eye view, to detect and classify objects. Both stages use an encoder-decoder architecture. We show that our multi-view, multi-stage, multi-class approach is able to detect and classify objects while simultaneously determining the drivable space using a single LiDAR scan as input, in challenging scenes with more than one hundred vehicles and pedestrians at a time. The system operates efficiently at 150 fps on an embedded GPU designed for a self-driving car, including a postprocessing step to maintain identities over time. We show results on both KITTI and a much larger internal dataset, thus demonstrating the method's ability to scale by an order of magnitude.

研究の動機と目的

  • 自動運転における LiDAR データのみを用いたリアルタイムで複数クラスの認識を実現すること。
  • 歩行者のような小さな、検出が難しい物体の検出精度を、透視図法的ビューでのセマンティックセグメンテーションを活用することで向上させること。
  • 1つの LiDAR スキャンを用いて、複数の物体クラスの検出と走行可能領域のセグメンテーションを同時に実行すること。
  • 複雑なデータオーグメンテーションに依存せずに、埋め込みハードウェア上で高い推論速度(150 fps)を達成すること。
  • 1フレームあたり100台以上の車両および歩行者が存在するような極めて混雑したシーンにも、スケーラブルに適応できること。

提案手法

  • 最初の段階では、LiDAR ポイントクラウドを透視図法的ビューに投影し、エンコーダ・デコーダネットワークを用いてセマンティックセグメンテーションを実行する。
  • 2番目の段階では、同じポイントクラウドを上空図的ビュー(BEV)に投影し、最初の段階で得られたセマンティックラベルと高さ特徴量を統合して物体検出を実行する。
  • 両段階とも空間的文脈を保持し、密度の高い予測を可能にするためにエンコーダ・デコーダアーキテクチャを採用する。
  • システムは1つの LiDAR スキャンを処理し、車両および歩行者の検出・分類と、リアルタイムでの走行可能領域のセグメンテーションを実現する。
  • フレーム間での物体の同一性を維持するため、時間的整合性を確保するために後処理を適用する。
  • ネットワークは、KITTI および数十万スキャンにのぼる大規模な社内データセットを用いて、エンド・トゥ・エンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1透視図法的ビューと上空図的ビューの両方の投影を用いる2段階のマルチビューネットワークは、単一ビュー手法と比較して、複数クラスの LiDAR 物体検出精度を向上させることができるか?
  • RQ2透視図法的ビューでのセマンティックセグメンテーションを組み込むことで、歩行者のような小さな、可視性が低い物体の検出が向上するか?
  • RQ31つの統合ネットワークが、複数の物体クラスの検出と走行可能領域のセグメンテーションを高い効率で同時に実行できるか?
  • RQ4100個以上の動的物体が存在するような極度に複雑なシーン下でも、システムの性能はどのように保たれるか?
  • RQ5実世界の自動運転データにおいて、提案されたアーキテクチャは、従来の手法と比較して、速度および精度の面でどの程度優れているか?

主な発見

  • システムは埋め込みGPU上で150 fpsを達成し、従来の手法と比較して顕著に高速な推論速度を実現した。
  • KITTI データセットにおいて、MVLidarNet は「簡単」な車両のAPスコアで89.27を達成し、最高性能を示す既存手法(89.66)と同等の精度を維持しながら、推論時間は半分の6.8 ms(対比:16 ms)にまで短縮された。
  • 123,000人以上の歩行者が含まれる社内データセットにおいて、0–10 m のIoUで歩行者のAPは72.29%に達し、上位から下への高さ特徴量のみのベースライン(51.75%)と比較して顕著な向上を示した。
  • アブレーションスタディの結果、セマンティックセグメンテーションとBEV検出を統合することで、短距離(0–10 m)での歩行者検出精度が20.5ポイント向上した。
  • 1フレームあたり100台以上の車両および歩行者が存在するシーンを効果的に処理でき、極めて複雑な現実世界のシナリオへのスケーラビリティを実証した。
  • 高解像度の Velodyne VLS-128 データセットでも、歩行者に対するAPは0–10 m で88.89%に達し、センサ構成の変更に対しても強力な汎化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。