[論文レビュー] Scene Understanding Networks for Autonomous Driving based on Around View Monitoring System
本稿では、魚眼レンズを搭載したアラウンドビューモニタリング(AVM)システムのみを用いて、自律走行のシーン理解を統合的かつエンド・ツー・エンドで行う深層学習フレームワークを提案する。物体検出、レーンマーク検出、走行可能領域のセグメンテーション、ボトムポイント推定による最近接障害物までの距離推定を同時に実行し、埋め込み型TX2プラットフォーム上で16.7 fpsの高速処理を達成しながら高い精度と低複雑性を実現した。
Modern driver assistance systems rely on a wide range of sensors (RADAR, LIDAR, ultrasound and cameras) for scene understanding and prediction. These sensors are typically used for detecting traffic participants and scene elements required for navigation. In this paper we argue that relying on camera based systems, specifically Around View Monitoring (AVM) system has great potential to achieve these goals in both parking and driving modes with decreased costs. The contributions of this paper are as follows: we present a new end-to-end solution for delimiting the safe drivable area for each frame by means of identifying the closest obstacle in each direction from the driving vehicle, we use this approach to calculate the distance to the nearest obstacles and we incorporate it into a unified end-to-end architecture capable of joint object detection, curb detection and safe drivable area detection. Furthermore, we describe the family of networks for both a high accuracy solution and a low complexity solution. We also introduce further augmentation of the base architecture with 3D object detection.
研究の動機と目的
- 自律走行におけるLIDARやマルチセンサーフュージョンの高コストを解消するため、カメラベースのシステムに依存することを目的とする。
- 魚眼カメラを用いたアラウンドビューモニタリング(AVM)システムを活用し、駐車モードおよび走行モードにおけるシーン理解を向上させることを目的とする。
- 物体検出、レーンマーク検出、走行可能領域セグメンテーション、障害物までの距離推定を同時に実行する統合的かつエンド・ツー・エンドの深層学習アーキテクチャの開発を目的とする。
- TX2プラットフォーム上で精度、推論速度(16.7 fps)、モデルサイズのバランスを最適化することで、埋め込み型デプロイメントを最適化することを目的とする。
- 高精度バージョンとして、3次元物体検出を用いた方向性および寸法推定を統合したフレームワークの拡張を目的とする。
提案手法
- 360°のAVMシステムから得られる魚眼カメラ入力を用いて、車両周辺の広視野画像を取得する。
- 各方向における最近接障害物を特定するためのボトムポイント推定を提案し、正確な距離推定を可能にする。
- 物体検出、レーンマーク検出、走行可能領域セグメンテーションの各タスクに特化したヘッドを備えた、共有エンコーダ(深さ倍率0.5のMobileNet)を有する統合的マルチタスクネットワーク(Unified-Net)を設計する。
- 効率的な2次元物体検出のためのワンショット検出(SSD)とアンカーボックスを採用し、特徴マップの統合を用いてマルチスケール検出を実現する。
- Inception-ResNet-V2エンコーダと密度アップサンプリング(HDUC)を用いた高精度な3D-Netバージョンを提案し、3次元物体の方向性および寸法推定を実現する。
- 推論速度と精度の最適化を図るため、アーキテクチャのアブレーションスタディを実施し、エンコーダーのサイズ、入力解像度、Unified-Netにおける分岐層の選択を検討する。
実験結果
リサーチクエスチョン
- RQ1カメラオンリーのAVMシステムは、マルチセンサーシステムと同等の信頼性の高いシーン理解を達成できるか?
- RQ2魚眼画像からのボトムポイント推定は、従来のセグメンテーションや検出手法と比較して、障害物までの距離および走行可能領域検出をどのように向上させられるか?
- RQ3TX2のような埋め込みプラットフォームに統合的認識ネットワークをデプロイする際、精度と推論速度の最適なトレードオフは何か?
- RQ4リアルタイム性能を損なわずに、軽量でエンド・ツー・エンドのアーキテクチャに3次元物体検出(方向性および寸法)を効果的に統合できるか?
- RQ5エンコーダーの選択、入力解像度、分岐層の設計といったアーキテクチャ設計が、マルチタスク認識ネットワークの性能にどのように影響するか?
主な発見
- 統合的で低複雑性のソリューションは、Nvidia TX2埋め込みプラットフォーム上で16.7 fpsを達成し、自律走行のリアルタイム要件を満たした。
- 最良の性能を示したUnified-Netアーキテクチャは、'conv5'層で分岐し、距離推定で2.77 MAE、物体検出で0.55 mAPのバランスを達成した。
- 深さ倍率0.5のMobileNetエンコーダとSSDデコーダーを組み合わせることで、低複雑性ソリューションにおいて精度と速度の最適なトレードオフが達成された。
- 高精度な3D-Netバージョンは、*-cycleクラスにおいて、方向性推定で平均絶対誤差(MAE)4.09°、Z方向寸法推定で0.132mを達成した。
- アブレーションスタディの結果、入力解像度をフルから640x360に低下させることで精度は低下したが、推論速度が向上し、960x540解像度が精度と速度の良好なバランスを提供した。
- Inception-ResNet-V2エンコーダとHDUCデコーダーを組み合わせたアーキテクチャが、ボトムポイント推定で最も低いMAE(3.7)を達成し、FCN-AおよびFCN-Bの各バージョンを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。