Skip to main content
QUICK REVIEW

[論文レビュー] Delivering Arbitrary-Modal Semantic Segmentation

Jiaming Zhang, Ruiping Liu|arXiv (Cornell University)|Mar 2, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、自己照合ハブ(SQ-Hub)による動的特徴選択と、並列プーリングミキサー(PPX)による効率的なクロスマodalなキュー抽出を可能にする、1〜81モダリティの柔軟な統合を可能にする、新しい任意モダリティ意味セグメンテーションモデルであるCMNeXtを提案する。6つのベンチマークで最先端性能を達成し、特にRGBのみのベースラインから+9.10%の向上を示す、新しいDeLiVERデータセットでは66.30%のmIoUを達成した。

ABSTRACT

Multimodal fusion can make semantic segmentation more robust. However, fusing an arbitrary number of modalities remains underexplored. To delve into this problem, we create the DeLiVER arbitrary-modal segmentation benchmark, covering Depth, LiDAR, multiple Views, Events, and RGB. Aside from this, we provide this dataset in four severe weather conditions as well as five sensor failure cases to exploit modal complementarity and resolve partial outages. To make this possible, we present the arbitrary cross-modal segmentation model CMNeXt. It encompasses a Self-Query Hub (SQ-Hub) designed to extract effective information from any modality for subsequent fusion with the RGB representation and adds only negligible amounts of parameters (~0.01M) per additional modality. On top, to efficiently and flexibly harvest discriminative cues from the auxiliary modalities, we introduce the simple Parallel Pooling Mixer (PPX). With extensive experiments on a total of six benchmarks, our CMNeXt achieves state-of-the-art performance on the DeLiVER, KITTI-360, MFNet, NYU Depth V2, UrbanLF, and MCubeS datasets, allowing to scale from 1 to 81 modalities. On the freshly collected DeLiVER, the quad-modal CMNeXt reaches up to 66.30% in mIoU with a +9.10% gain as compared to the mono-modal baseline. The DeLiVER dataset and our code are at: https://jamycheung.github.io/DELIVER.html.

研究の動機と目的

  • 意味セグメンテーションにおける任意の数のモダリティを統合する研究が不足していること、特に現実世界のセンサー障害や悪劣な環境下での統合についての課題を解決すること。
  • 固定されたモダリティペアに特化した従来手法の限界を克服し、スケーラビリティと耐障害性を向上させること。
  • RGB、深度、LiDAR、イベント、偏光、光場など、多様なモダリティを動的に統合できる統一フレームワークを構築し、計算コストを低く抑えること。
  • 異なるモダリティ間の補完的情報を活用することで、部分的センサ障害や悪天候下でもロバストなセグメンテーションを実現すること。
  • 現実の障害や環境的要因を想定した条件下で、任意モダリティ意味セグメンテーションの研究を支援する包括的ベンチマーク、DeLiVERを構築すること。

提案手法

  • 非対称ブランチを備えたHub2Fuseパラダイムを提案:RGB用と補助モダリティ用の別々のブランチを設け、柔軟で効率的な統合を実現する。
  • 任意の数の補助モダリティから情報を得た特徴を動的に選択するための自己照合ハブ(SQ-Hub)を設計。モダリティ1つあたり約0.01Mパラメータの追加で実現。
  • 並列プーリングミキサー(PPX)を導入。モダリティ間で並列的に空間プーリングを適用することで、効率的に特徴的なクロスマodalなキューを抽出する軽量モジュール。
  • PPXをクロス統合モジュールと統合し、RGBのような密度の高いモダリティと、LiDAR やイベントのようなスパarsityの高いモダリティを効果的に処理できるようにする。
  • RGBブランチにはMHSAブロック、補助ブランチにはPPXを採用。自己注意機構が密度の高い表現処理に優れているのに対し、PPXがクロスマodalな知識抽出に優れていることを実証。
  • SQ-Hub、PPX、およびその部品(SEブロック、FRM/FFMモジュール)の有効性を検証するための広範なアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1統一モデルは、意味セグメンテーションにおいて1〜81モダリティの多様で任意の組み合わせに対して最先端性能を達成できるか?
  • RQ2増加するモダリティ数に伴って、CMNeXtモデルは高い精度を維持するとともに、パラメータ増加を抑えることができるか?
  • RQ3LiDARのジャイタリティや部分的停止などのセンサ障害下でも、モデルはどの程度ロバストな性能を維持できるか?
  • RQ4PPXモジュールは、畳み込み型、プーリング型、またはアテンションベースの代替手法と比較して、多様なモダリティから特徴を効果的に抽出できるか?
  • RQ5SQ-Hub機構は、動的かつモダリティに依存しない特徴選択を可能にし、統合の効率性と性能向上に寄与するか?

主な発見

  • DeLiVERベンチマークでは、RGB、深度、イベント、LiDARの4モダリティ設定で66.30%のmIoUを達成。RGBのみのベースラインから+9.10%の向上を示した。
  • UrbanLF-Realでは前人最高(SoTA)の手法を+3.90% mIoU上回り、MCubeSでは+8.68%上回った。これは、異なるデータセット間で優れた汎化性能を示している。
  • PPXモジュールは、MHSA、ConvNeXt、PoolFormer、MSCAなど、すべてのテストブロックの中で最高のmIoU(66.30%)を達成。パラメータは58.73M、計算量は65.42 GFLOPsと非常に効率的だった。
  • アブレーションスタディでは、PPX内のSEブロックを削除するとmIoUが3.03%低下した。これは、チャネルワイドなアテンションがクロスマodal特徴学習において重要であることを確認した。
  • FRMおよびFFMモジュールはクロスマodal相互作用を顕著に向上させ、それらを削除するとmIoUが1.89%低下した。
  • センサ障害シナリオ(例:LiDARのジャイタリティ)においても、CMNeXtはロバストな性能を維持した。一方、CMX や HRFuser などの従来手法は著しい性能低下を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。