Skip to main content
QUICK REVIEW

[論文レビュー] FusionPainting: Multimodal Fusion with Adaptive Attention for 3D Object Detection

Shaoqing Xu, Dingfu Zhou|arXiv (Cornell University)|Jun 23, 2021
Advanced Neural Network Applications参考文献 47被引用数 9
ひとこと要約

FusionPaintingは、注意機構を用いたモジュールにより、2次元画像と3次元点群のセマンティックセグメンテーションを適応的に統合する、新しいマルチモーダル統合フレームワークを提案する。この手法により、3次元オブジェクト検出の性能が向上し、nuScenesベンチマークにおいて、従来の手法を8.1 NDSポイントおよび13.6 mAPポイント上回る最先端の性能を達成した。

ABSTRACT

Accurate detection of obstacles in 3D is an essential task for autonomous driving and intelligent transportation. In this work, we propose a general multimodal fusion framework FusionPainting to fuse the 2D RGB image and 3D point clouds at a semantic level for boosting the 3D object detection task. Especially, the FusionPainting framework consists of three main modules: a multi-modal semantic segmentation module, an adaptive attention-based semantic fusion module, and a 3D object detector. First, semantic information is obtained for 2D images and 3D Lidar point clouds based on 2D and 3D segmentation approaches. Then the segmentation results from different sensors are adaptively fused based on the proposed attention-based semantic fusion module. Finally, the point clouds painted with the fused semantic label are sent to the 3D detector for obtaining the 3D objection results. The effectiveness of the proposed framework has been verified on the large-scale nuScenes detection benchmark by comparing it with three different baselines. The experimental results show that the fusion strategy can significantly improve the detection performance compared to the methods using only point clouds, and the methods using point clouds only painted with 2D segmentation information. Furthermore, the proposed approach outperforms other state-of-the-art methods on the nuScenes testing benchmark.

研究の動機と目的

  • 単一モダリティの3次元オブジェクト検出の限界、特に2次元セグメンテーションにおける境界のぼやけによる誤検出を是正すること。
  • 2次元RGB画像と3次元LiDAR点群の両方のセマンティック情報をセマンティックレベルで統合することで、検出精度を向上させること。
  • 任意の3次元検出器を向上させることを目的とした、一般化可能で検出器に依存しないフレームワークを構築すること。
  • 従来の統合手法の欠点(不正確な2次元投影や限られた3次元テクスチャ理解)を、両モダリティの補完的強みを組み合わせることで是正すること。

提案手法

  • フレームワークは、市販のモデルを用いて2次元画像と3次元点群からセマンティックラベルを抽出するマルチモーダルセマンティックセグメンテーションモジュールを採用する。
  • 適応的アテンションに基づくセマンティック統合モジュールは、ボクセルレベルの特徴空間における文脈的情報に基づき、2次元および3次元セグメンテーション特徴の重要度を学習する。
  • 統合プロセスにより、各3次元点に対して洗練されたセマンティックラベルが生成され、その後、点群に強化されたセマンティックコンテキストを「塗りつぶす」ために使用される。
  • 塗りつぶされた点群は、最終的な検出推論のため、3次元オブジェクト検出器(例:CenterPoint、PointPillars)に供給される。
  • アテンションモジュールは検出器と同時にEnd-to-Endで学習され、局所的なシーンコンテキストに応じてモダリティ固有のアテンション重みを学習可能となる。
  • 本手法は、ポイントベースおよびボクセルベースの3次元検出器の両方と互換性があり、汎用的な統合フレームワークである。

実験結果

リサーチクエスチョン

  • RQ12次元および3次元セマンティックセグメンテーションの結果を統合することで、単独で使用するいずれのモダリティよりも3次元オブジェクト検出性能が向上するか?
  • RQ22次元画像セグメンテーション(高精度なテクスチャ、低深度情報)と3次元点群セグメンテーション(オクルージョン耐性、幾何的正確性)の補完的強みを効果的に統合する方法は何か?
  • RQ3適応的アテンション機構は、固定重みまたはエアリー統合戦略を上回る性能を示せるか?
  • RQ4提案された統合戦略は、異なる3次元検出器に一般化可能であり、性能向上を維持できるか?

主な発見

  • 適応的アテンションモジュールを用いて2次元および3次元のペイント処理を実施した場合、ベースラインのCenterPointに比べてmAPが11.30ポイント、NDSが5.45ポイント向上した。
  • 本手法は、nuScenesテストセットで66.53%のmAPおよび70.68%のNDSを達成し、以前の最先端手法3DCVFを8.1 NDSポイントおよび13.6 mAPポイント上回った。
  • アブレーションスタディの結果、2次元セグメンテーションのみでmAPが21.90%、NDSが8.46%向上した一方、3次元セグメンテーションのみでmAPが9.81%、NDSが3.92%向上した。
  • 2次元および3次元ペイントを適応的アテンションモジュールで統合した場合、3つの検出器平均でmAPが26.58%、NDSが10.90%の向上が得られた。
  • 定性的な結果から、FusionPaintingは2次元ペイントによる誤検出を低減し、境界検出性能を2次元単独または3次元単独のペイントよりも向上させた。
  • フレームワークは検出器に依存せず、CenterPoint、PointPillars、および他の3次元検出器に対しても一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。