Skip to main content
QUICK REVIEW

[論文レビュー] OccFusion: Multi-Sensor Fusion Framework for 3D Semantic Occupancy Prediction

Zhenxing Ming, Julie Stephany Berrío|arXiv (Cornell University)|Mar 3, 2024
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

OccFusionは、360°カメラ、ライダー、レーダーのデータを統合する動的マルチセンサーフュージョンフレームワークを提案し、3Dセマンティックオカッパイア予測を実現する。新規の3D/2D動的フュージョングモジュールを用いて、耐障害性と精度を向上させる。nuScenesベンチマークにおいて、特に夜間や雨天時のような困難な条件下で最先端の性能を達成し、カメラオンリーベースラインと比較して最大6.5%のmIoU向上を達成した。

ABSTRACT

A comprehensive understanding of 3D scenes is crucial in autonomous vehicles (AVs), and recent models for 3D semantic occupancy prediction have successfully addressed the challenge of describing real-world objects with varied shapes and classes. However, existing methods for 3D occupancy prediction heavily rely on surround-view camera images, making them susceptible to changes in lighting and weather conditions. This paper introduces OccFusion, a novel sensor fusion framework for predicting 3D occupancy. By integrating features from additional sensors, such as lidar and surround view radars, our framework enhances the accuracy and robustness of occupancy prediction, resulting in top-tier performance on the nuScenes benchmark. Furthermore, extensive experiments conducted on the nuScenes and semanticKITTI dataset, including challenging night and rainy scenarios, confirm the superior performance of our sensor fusion strategy across various perception ranges. The code for this framework will be made available at https://github.com/DanielMing123/OccFusion.

研究の動機と目的

  • 悪質な照明および天候条件下におけるカメラオンリーフュージョングモジュールの限界を是正すること。
  • ライダー(幾何的正確性)とレーダー(天候耐性)の補完的利点をカメラ(セマンティックの豊かさ)と統合し、より良いシーン理解を実現すること。
  • 多様な認識範囲および環境条件下でモデルの耐障害性を向上させる統一的で効率的なフュージョングモジュールの開発。
  • nuScenesベンチマークを用いて、夜間や雨天時などの困難なシナリオにおけるマルチセンサーフュージョング戦略の性能向上を評価すること。

提案手法

  • カメラのBEV特徴量とライダーおよびレーダーの3D特徴ボリュームを、学習可能なアテンション機構を用いて統合する動的フュージョング3D/2Dモジュールを提案。
  • マルチスケールの粗いから細かいフィンガーリファインメント構造にマルチレベルの監視を組み合わせ、全空間レベルでの特徴表現を向上。
  • 3D特徴フュージョングをガイドするためのグローバルなエクcitationシグナルとしてのBEV特徴量を導入し、収束を加速。
  • 2Dおよび3D空間にそれぞれSENetブロックを適用し、マルチモodal特徴を動的に再キャリブレーションすることで、重要特徴の増幅を強化。
  • 3つのフュージョング戦略(カメラ+レーダー、カメラ+ライダー、カメラ+ライダー+レーダー)をサポートし、アブレーションおよび比較分析を可能に。
  • 3Dへのリフトの前段階で鳥瞰図(BEV)空間で特徴レベルのフュージョングを実施し、効果的なクロスモダリティ相互作用を実現。
Figure 1 : The figure above demonstrates the pipeline of two approaches: The purely vision-centric approach (top) and the multi-sensor fusion approach (bottom). We conduct 3D semantic occupancy prediction by doing feature fusion with respect to three modality feature volumes.
Figure 1 : The figure above demonstrates the pipeline of two approaches: The purely vision-centric approach (top) and the multi-sensor fusion approach (bottom). We conduct 3D semantic occupancy prediction by doing feature fusion with respect to three modality feature volumes.

実験結果

リサーチクエスチョン

  • RQ1ライダーおよびレーダーをカメラデータと統合することで、悪質な照明および天候条件下における3Dセマンティックオカッパイア予測にどのような向上が得られるか?
  • RQ2異なる認識範囲において、各センサーモダリティ(カメラ、ライダー、レーダー)が最終予測性能に果たす相対的寄与度は何か?
  • RQ3提案された動的フュージョング3D/2Dモジュールは、単純な連結や固定アテンション機構と比較して、マルチモーダル特徴フュージョングにおいてどのように優れているか?
  • RQ4マルチスケールの監視およびフィンガーリファインメントが、モデルの収束および性能に与える影響は何か?
  • RQ5カメラ+ライダー+レーダーの完全なセンサーフュージョング戦略は、夜間や雨天時などの極端なシナリオにおいて、単一または二重モダリティのベースラインと比較してどのように性能を発揮するか?

主な発見

  • 完全なOccFusionフレームワーク(カメラ+ライダー+レーダー)は、nuScenesバリデーションセットで平均交差率(mIoU)30.97%を達成し、カメラオンリーベースラインを上回った。
  • 夜間および雨天時において、ライダーおよびレーダーの追加により、mIoUがカメラオンリーモデルと比較して最大6.5ポイント向上した。
  • マルチスケールの粗いから細かいフィンガーリファインメント構造にマルチレベル監視を組み合わせたことで、単一スケールベースラインと比較してmIoUが5.23ポイント向上した。
  • 動的フュージョングモジュールにおけるBEV特徴量の削除により、mIoUが6.5%低下した。これは、3D特徴フュージョングをガイドする上でその重要性を示している。
  • SENet3DおよびSENet2Dブロックは性能向上に顕著な寄与を示し、両方を無効化した場合、mIoUが6%以上低下した。
  • フレームワークは、さまざまな認識範囲においても強力な性能を維持しており、カメラ+ライダー+レーダーのフュージョング戦略は、全範囲で一貫した向上を示した。
Figure 2 : Overall architecture of OccFusion. Firstly, the surround-view images were inputted into the 2D backbone to extract multiple-scale features. Subsequently, a view transformation is conducted at each scale to obtain the global BEV feature and the local 3D feature volume at each level. The 3D
Figure 2 : Overall architecture of OccFusion. Firstly, the surround-view images were inputted into the 2D backbone to extract multiple-scale features. Subsequently, a view transformation is conducted at each scale to obtain the global BEV feature and the local 3D feature volume at each level. The 3D

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。