Skip to main content
QUICK REVIEW

[論文レビュー] Fast-BEV: Towards Real-time On-vehicle Bird's-Eye View Perception

Bin Huang, Yangguang Li|arXiv (Cornell University)|Jan 19, 2023
Robotics and Sensor-Based Localization被引用数 7
ひとこと要約

Fast-BEV は、高価な深度推定やトランスフォーマーに基づくビュー変換に依存せずに、最先端の性能を達成するリアルタイムで車載機器に最適化されたビューアー・エイド・ビュー(BEV)認識フレームワークを提案する。画像空間およびBEV空間における強力なデータ拡張、マルチフレーム時空間融合、および最適化されたデプロイメントフレンドリーなビュー変換(事前計算されたプロジェクションインデックスと共有の密なボクセル特徴量を用いて)により、nuScenesで53.5%のNDSを達成し、エッジハードウェアでも50 FPSを超える推論速度を実現した。

ABSTRACT

Recently, the pure camera-based Bird's-Eye-View (BEV) perception removes expensive Lidar sensors, making it a feasible solution for economical autonomous driving. However, most existing BEV solutions either suffer from modest performance or require considerable resources to execute on-vehicle inference. This paper proposes a simple yet effective framework, termed Fast-BEV, which is capable of performing real-time BEV perception on the on-vehicle chips. Towards this goal, we first empirically find that the BEV representation can be sufficiently powerful without expensive view transformation or depth representation. Starting from M2BEV baseline, we further introduce (1) a strong data augmentation strategy for both image and BEV space to avoid over-fitting (2) a multi-frame feature fusion mechanism to leverage the temporal information (3) an optimized deployment-friendly view transformation to speed up the inference. Through experiments, we show Fast-BEV model family achieves considerable accuracy and efficiency on edge. In particular, our M1 model (R18@256x704) can run over 50FPS on the Tesla T4 platform, with 47.0% NDS on the nuScenes validation set. Our largest model (R101@900x1600) establishes a new state-of-the-art 53.5% NDS on the nuScenes validation set. The code is released at: https://github.com/Sense-GVT/Fast-BEV.

研究の動機と目的

  • 高価なLiDARやトランスフォーマー、深度推定などのリソース集約型コンponentsに依存せずに、リアルタイムで車載にデプロイ可能なBEV認識システムを開発すること。
  • モデルの複雑さや推論時の計算コストを増加させることなく、BEVベンチマークにおける検出性能を向上させること。
  • エッジデプロイメントに最適化された画像からBEVへのビュー変換を最適化し、遅延を低減するとともに、ハードウェア互換性を向上させること。
  • 埋め込みチップ上で動作する標準的な畳み込みネットワークと効率的な推論パイプラインを用いて、高性能なBEV認識を実現すること。

提案手法

  • 過学習を防ぎ、耐障害性を向上させるために、画像空間およびBEV空間の両方で強力なデータ拡張を実装する。
  • 履歴フレームからの時空間的情報を活用するマルチフレーム特徴融合機構を導入し、検出精度を向上させる。
  • 各推論ごとに計算を回避するため、固定のプロジェクションインデックスを事前計算して静的ルックアップテーブルとして利用することで、画像からBEVへのプロジェクションを最適化する。
  • すべてのカメラ特徴量を共有の密なボクセルグリッドに投影することでボクセル集約の遅延を低減し、スパースな集約処理を回避する。
  • トランスフォーマーの注意メカニズムや深度分布予測を避けるために、M²BEVに基づく完全な畳み込みアーキテクチャを採用する。
  • 計算リソースが限られた車載エッジデバイスに適した、軽量でデプロイメント最適化された推論パイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1画像空間およびBEV空間における強力なデータ拡張が、モデルの複雑さを増さずにBEV検出性能を顕著に向上させることができるか?
  • RQ2複数フレームからの時空間的情報を統合することで、BEV空間における3次元オブジェクト検出性能がどの程度向上するか?
  • RQ3エッジプラットフォーム上でサブミリ秒未満の推論遅延を達成できるように、画像からBEVへのビュー変換を最適化できるか?
  • RQ4トランスフォーマーや深度推定を一切使わず、標準的な畳み込みネットワークのみで最先端のBEV検出性能を達成できるか?
  • RQ5強力な拡張処理と時空間融合の組み合わせが、学習収束性と最終的なモデル精度にどのように影響を与えるか?

主な発見

  • 最大のR101ベースアーキテクチャ(900×1600入力解像度)を用いたFast-BEVモデルファミリーは、nuScenes検証セットで53.5%のNDSという新たな最先端性能を達成した。
  • M1モデル(R18@256×704)はTesla T4上で50 FPSを超える推論速度を達成し、標準ハードウェアでもリアルタイム性能を実現した。
  • 画像空間とBEV空間の両方での拡張処理を組み合わせることで、ベースライン比で4.4%の絶対的NDS向上が達成され、マルチスペース拡張の有効性が裏付けられた。
  • 4つの履歴フレームを用いたマルチフレーム時空間融合により、NDSが9.3%向上し、BEV検出における時空間モデリングの価値が明確に示された。
  • プロジェクションインデックスを事前計算し、共有の密なボクセルグリッドを採用することで、元のM²BEVと比較してビュー変換の遅延が1桁以上短縮された。
  • 最大のFast-BEVモデルは832×1440入力解像度で49.1%のNDSを達成し、928×1600を超える解像度では性能が頭打ちになることが確認され、高解像度での利得が減少することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。