Skip to main content
QUICK REVIEW

[論文レビュー] FIERY: Future Instance Prediction in Bird's-Eye View from Surround Monocular Cameras

Anthony Hu, Zak Murez|arXiv (Cornell University)|Apr 21, 2021
Autonomous Vehicle Technology and Safety参考文献 48被引用数 14
ひとこと要約

FIERYは、高精細地図を必要とせず、周囲のRGB入力を用いて、エイド・バイ・ビュー(BEV)で確率的未来インスタンス予測をエンド・ツー・エンドで行う、最初のモノクロナリ・カメラベースのモデルである。マルチモーダルな軌道とセグメンテーションを直接回帰する。NuScenesおよびLyftデータセットにおいて、最先端の性能を達成している。認識、センサーフュージョン、予測を統合されたフレームワークで同時に学習することで実現している。

ABSTRACT

Driving requires interacting with road agents and predicting their future behaviour in order to navigate safely. We present FIERY: a probabilistic future prediction model in bird's-eye view from monocular cameras. Our model predicts future instance segmentation and motion of dynamic agents that can be transformed into non-parametric future trajectories. Our approach combines the perception, sensor fusion and prediction components of a traditional autonomous driving stack by estimating bird's-eye-view prediction directly from surround RGB monocular camera inputs. FIERY learns to model the inherent stochastic nature of the future solely from camera driving data in an end-to-end manner, without relying on HD maps, and predicts multimodal future trajectories. We show that our model outperforms previous prediction baselines on the NuScenes and Lyft datasets. The code and trained models are available at https://github.com/wayveai/fiery.

研究の動機と目的

  • モノクロナリ・カメラ入力のみを用いて、自動運転における未来の運動およびインスタンスレベルのダイナミクスを予測する課題に対処すること。
  • エイド・バイ・ビュー(BEV)で認識、センサーフュージョン、予測を統合的に学習することで、高精細地図やマルチステージパイプラインへの依存を排除すること。
  • 将来の軌道に内在する確率的性質を、確率的でマルチモーダルな予測フレームワークによりモデル化すること。
  • RGB画像から直接BEV表現に回帰することで、運動計画に適した高解像度の未来シーン理解を可能にすること。
  • エッジ・トゥ・エッジでの学習が、地図やLiDAR依存のベースラインと同等またはそれ以上の性能を達成できることを実証すること。

提案手法

  • 1/8解像度の特徴量を抽出するために、EfficientNet-B4バックボーンを用いたマルチカメラRGB入力ストリームを使用する。
  • エゴ・モーションを用いて、空間変換器と幾何的リフトを適用し、2D画像特徴量を200×200のエイド・バイ・ビュー(BEV)特徴マップに投影する。
  • 時間的特徴量を3次元畳み込みと時間的ブロック(Temporal Blocks)を用いて、過去のタイムステップにわたる空間時間的ダイナミクスを符号化する。
  • インスタンスセグメンテーション(センター感度、オフセット)、フロー、および未来予測の複数出力ヘッドを共有するデコーダーヘッドを導入する。
  • 不確実性重み付けを施した確率的損失と、変分的スタイルの分布ヘッドを用いて、マルチモーダルな未来状態を予測する。
  • 将来のインスタンス位置と運動を監視するために、インスタンスの重心のガウスラベルとフローに基づくラベルを活用する。

実験結果

リサーチクエスチョン

  • RQ11つのエンド・ツー・エンドモデルは、モノクロナリ・カメラ入力からのみ、エイド・バイ・ビュー(BEV)でマルチモーダルな未来のインスタンスセグメンテーションと運動を予測できるか?
  • RQ2生のRGBデータからのエンド・ツー・エンド学習は、マルチステージまたは地図支援アプローチと比較して、将来予測性能においてどのように異なるか?
  • RQ3明示的な高精細地図のガイドなしで、モデルは将来のエージェント行動の確率的性質をどの程度学習できるか?
  • RQ4中間の監視なしに、認識、センサーフュージョン、未来予測を統合的に最適化できる一貫したアーキテクチャは可能か?
  • RQ5現実のドライブシナリオにおいて、決定論的ベースラインと比較して、確率的でマルチモーダルな予測ヘッドはどの程度の性能向上をもたらすか?

主な発見

  • FIERYは、NuScenesおよびLyftデータセットの両方で、従来の予測ベースラインを上回り、未来のインスタンスセグメンテーションおよび運動予測において最先端の結果を達成した。
  • 高精細地図に依存せず、モノクロナリ・カメラからのエンド・ツー・エンド学習が、複雑な予測タスクにおいて実現可能であることを実証した。
  • 不確実性重み付けを施した確率的損失の使用により、耐障害性とマルチモーダルな軌道生成の両方が顕著に向上した。
  • 3次元畳み込みとゲート付き再帰ユニット(GRU)を用いた時間的モデリングにより、過去のタイムステップにわたる正確な空間時間的特徴量学習が可能になった。
  • カメラの幾何学的特徴とエゴ・モーションのみを用いて、2D画像特徴量を幾何学的に整合性のあるBEV表現に効果的にリフトできた。
  • Lyftデータセットの6,174サンプルからなるホールドアウト分割で検証された結果、モデルは未観測シーンに対しても良好な汎化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。