[論文レビュー] Fast-BEV: A Fast and Strong Bird's-Eye View Perception Baseline
Fast-BEV は、車載チップ上で低遅延で高い性能を達成する、高速で強力かつデプロイに適した自動運転用ビューアー・エイド(BEV)認識フレームワークを提案する。2次元から3次元への特徴投影を効率的に行う新規の Fast-Ray 変換を採用し、マルチスケール画像エンコーダー、効率的な BEV エンコーダー、時間的統合を組み合わせることで、高価なトランスフォーマーや深度監督に依存せずにリアルタイム推論(nuScenes で最高 53.5% NDS)を実現する。
Recently, perception task based on Bird's-Eye View (BEV) representation has drawn more and more attention, and BEV representation is promising as the foundation for next-generation Autonomous Vehicle (AV) perception. However, most existing BEV solutions either require considerable resources to execute on-vehicle inference or suffer from modest performance. This paper proposes a simple yet effective framework, termed Fast-BEV , which is capable of performing faster BEV perception on the on-vehicle chips. Towards this goal, we first empirically find that the BEV representation can be sufficiently powerful without expensive transformer based transformation nor depth representation. Our Fast-BEV consists of five parts, We novelly propose (1) a lightweight deployment-friendly view transformation which fast transfers 2D image feature to 3D voxel space, (2) an multi-scale image encoder which leverages multi-scale information for better performance, (3) an efficient BEV encoder which is particularly designed to speed up on-vehicle inference. We further introduce (4) a strong data augmentation strategy for both image and BEV space to avoid over-fitting, (5) a multi-frame feature fusion mechanism to leverage the temporal information. Through experiments, on 2080Ti platform, our R50 model can run 52.6 FPS with 47.3% NDS on the nuScenes validation set, exceeding the 41.3 FPS and 47.5% NDS of the BEVDepth-R50 model and 30.2 FPS and 45.7% NDS of the BEVDet4D-R50 model. Our largest model (R101@900x1600) establishes a competitive 53.5% NDS on the nuScenes validation set. We further develop a benchmark with considerable accuracy and efficiency on current popular on-vehicle chips. The code is released at: https://github.com/Sense-GVT/Fast-BEV.
研究の動機と目的
- リソース制限のある車載チップに高パフォーマンスな BEV 認識モデルをデプロイする課題に対処すること。
- トランスフォーマーや深度予測に依存する従来の BEV メソッドの遅い推論速度とデプロイの難易度を克服すること。
- NVIDIA Xavier や非GPUチップを含む低計算能力プラットフォームでも効率的でリアルタイムの推論を可能にすること。
- 深度監督なしで実世界のカメラデータのみを用いてスケーラブルなモデルのトレーニングとデプロイを可能にすること。
- 速度、正確性、デプロイ可能性のバランスを取った、完全な畳み込み型でエンドツーエンドの BEV フレームワークを開発すること。
提案手法
- カメラの光線に沿った特徴投影を高速化するため、Look-Up-Table と Multi-View to One-Voxel 操作を用いた軽量でデプロイに適した 2次元から3次元へのビュー変換である Fast-Ray 変換を提案する。
- 遅延を増加させずに性能を向上させるために、3段階の FPN 構造を持つマルチスケール画像エンコーダーを採用し、マルチスケール特徴を抽出・投影する。
- 計算コストを低減し、車載チップでの推論を高速化するために、最小限の残差ブロックを用いた効率的な BEV エンコーダーを設計する。
- 過学習を防ぎ、耐性を向上させるために、画像空間および BEV 空間の両方で強力なデータ拡張戦略を適用する。
- 時間的情報を活用して検出精度を向上させるために、複数フレームの特徴統合メカニズムを導入する。
- CUDA-TensorRT-INT8 を用いて、Xavier、Orin、T4 プラットフォームでの推論速度ベンチマークを含め、車載チップ上でのデプロイを最適化したパイプライン全体を実装する。
実験結果
リサーチクエスチョン
- RQ1低計算能力の車載チップ上で、低遅延を維持しながら高パフォーマンスを達成できる BEV 認識フレームワークは構築可能か?
- RQ2正確性を損なわずに、高価な深度監督やトランスフォーマーに基づくアテンション機構を排除することは可能か?
- RQ3軽量な変換と効率的なエンコーダーを備えた完全な畳み込み型マルチスケール BEV フレームワークは、実世界のデプロイ環境でどれほど効果的か?
- RQ4深度アノテーションなしで実世界のカメラデータのみを用いてトレーニングした場合でも、フレームワークは強力なパフォーマンスを維持できるか?
- RQ5さまざまな車載ハードウェアプラットフォームにおいて、モデルサイズ、推論速度、正確性のトレードオフはどのように変化するか?
主な発見
- 2080Ti プラットフォームでは、Fast-BEV の R50 モデルが nuScenes 検証セットで 52.6 FPS、47.3% NDS を達成し、BEVDepth-R50(41.3 FPS、47.5% NDS)および BEVDet4D-R50(30.2 FPS、45.7% NDS)を上回る性能を示した。
- 最大の Fast-BEV モデル(R101@900x1600)は、nuScenes 検証セットで競争力ある 53.5% NDS を達成し、優れたパフォーマンスを示した。
- AGX Xavier プラットフォームでは、M0 モデルが 19.7 FPS を達成し、低計算能力プラットフォームでもリアルタイム推論を実現した。
- AGX Orin プラットフォームでは、M2 モデルが 43.3 FPS を達成し、R50 シリーズと同等のパフォーマンスを維持した。リアルタイム推論要件を満たした。
- フレームワークは強力なデプロイの柔軟性を示し、CPUフレンドリーで CUDA 最適化された設計により、Texas Instruments の DSP や非GPUチップのサポートも可能となった。
- 深度監督やトランスフォーマーの欠如により、深度アノテーションなしの実世界のカメラデータのみを用いた学習・デプロイが、Fast-BEV においても効果的に実現できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。