Skip to main content
QUICK REVIEW

[論文レビュー] Customize Segment Anything Model for Multi-Modal Semantic Segmentation with Mixture of LoRA Experts

Chenyang Zhu, Bin Xiao|arXiv (Cornell University)|Dec 5, 2024
Big Data and Business IntelligenceBusiness, Management and Accounting被引用数 3
ひとこと要約

本論文は、元のSAMの重みを凍結したまま、モダリティ固有のLoRAアダプタを訓練することで、マルチモーダルセマンティックセグメンテーションに適応するMixture of LoRA Expertsフレームワーク、MLE-SAMを提案する。状態手の性能を達成し、特にモダリティ欠損状況下でも顕著な性能向上を示し、MUSESデータセットにおいて先行手法より32.15%のmIoU向上を達成した。

ABSTRACT

The recent Segment Anything Model (SAM) represents a significant breakthrough in scaling segmentation models, delivering strong performance across various downstream applications in the RGB modality. However, directly applying SAM to emerging visual modalities, such as depth and event data results in suboptimal performance in multi-modal segmentation tasks. In this paper, we make the first attempt to adapt SAM for multi-modal semantic segmentation by proposing a Mixture of Low-Rank Adaptation Experts (MoE-LoRA) tailored for different input visual modalities. By training only the MoE-LoRA layers while keeping SAM's weights frozen, SAM's strong generalization and segmentation capabilities can be preserved for downstream tasks. Specifically, to address cross-modal inconsistencies, we propose a novel MoE routing strategy that adaptively generates weighted features across modalities, enhancing multi-modal feature integration. Additionally, we incorporate multi-scale feature extraction and fusion by adapting SAM's segmentation head and introducing an auxiliary segmentation head to combine multi-scale features for improved segmentation performance effectively. Extensive experiments were conducted on three multi-modal benchmarks: DELIVER, MUSES, and MCubeS. The results consistently demonstrate that the proposed method significantly outperforms state-of-the-art approaches across diverse scenarios. Notably, under the particularly challenging condition of missing modalities, our approach exhibits a substantial performance gain, achieving an improvement of 32.15% compared to existing methods.

研究の動機と目的

  • RGB以外の視覚モダリティ(例:深度、イベントデータ)に事前学習されたSegment Anything Model(SAM)を適用する課題に対処すること。これらのモダリティは特徴が著しく異なり、SAMの性能を低下させる。
  • RGB、深度、イベント、LiDARなどの異種モダリティを統合する際のクロスモダリティの不一致と最適でない特徴統合を克服すること。
  • 元のモデル重みを凍結することで、SAMの強力な一般化能力とゼロショット能力を維持しながら、軽量なLoRAアダプタのみをファインチューニングすること。
  • 動的なMoEルーティング機構とマルチスケール特徴統合を用いて、欠損またはノイズのあるモダリティが存在する現実世界のシナリオでも耐性を高めること。
  • DELIVER、MUSES、MCubeSを含む多様なマルチモーダルベンチマークで、標準的および悪条件下においても優れたセグメンテーション精度を達成すること。

提案手法

  • 各モダリティ(例:RGB、深度、イベント)に固有のLoRAアダプタを割り当てることで、モダリティ固有の適応を実現するMixture of Low-Rank Adaptation Experts(MoE-LoRA)フレームワークを導入する。
  • 動的なMoEルーティング機構を設計し、モダリティ間の注意重みを適応的に計算することで、重み付きの統合特徴を生成し、クロスモダリティの一貫性と統合を向上させる。
  • SAMのセグメンテーションヘッドを変更し、マルチスケール特徴を抽出・統合する補助ヘッドを追加することで、特徴表現とセグメンテーション精度を向上させる。
  • 元のSAMの重みをすべて凍結し、LoRAアダプタと補助ヘッドのみを訓練することで、SAMの一般化能力を保証する。
  • 元のヘッドと補助ヘッドの両方を活用する二重パスマスク予測戦略を実装し、マルチスケール統合によるマスク品質の向上を実現する。
  • MoE-LoRAフレームワークをDELIVER、MUSES、MCubeSの3つのベンチマークに適用し、ノイズやモダリティ欠損状況下での広範なアブレーションおよび耐性評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1LoRAベースのファインチューニングは、元の重みを変更せずに、事前学習済みSegment Anything Model(SAM)をRGB以外の視覚モダリティに効果的に適応可能か?
  • RQ2Mixture of Expertsルーティング機構は、異種データにおけるマルチモーダル特徴統合とクロスモダリティの不一致をどのように改善できるか?
  • RQ3補助セグメンテーションヘッドによるマルチスケール特徴統合は、マルチモーダル環境下でのセグメンテーション性能をどの程度向上させるか?
  • RQ4提案されたMLE-SAMフレームワークは、既存の最先端手法と比較して、モダリティ欠損やノイズのある現実世界の課題に対してどのように性能を発揮するか?
  • RQ5MoEルーティング、マルチスケール統合、補助ヘッドの各コンポonentが、マルチモーダルセマンティックセグメンテーションにおける全体的な性能向上に果たす寄与度はどの程度か?

主な発見

  • DELIVERデータセット(4モダリティ:R-D-E-L)において、MLE-SAMは最先端手法比で+4.9%のmIoU向上を達成した。
  • MUSESデータセット(3モダリティ:F-E-L)において、MLE-SAMは+28.14%のmIoU向上を達成し、複雑なマルチモーダルシナリオでも優れた性能を示した。
  • モダリティ欠損状況下では、MUSESデータセットにおいて既存手法比で32.15%のmIoU向上を達成し、高い耐性を示した。
  • ノイズのあるテスト条件下では、MLE-SAMはCWSAMおよびSAM-LoRAをすべてのモダリティで上回り、ランダムノイズ下でのRGBモダリティで32.42%のmIoU向上を達成した。
  • MoEルーティング機構は、密度の高い(RGB、深度)とスパarsityの高い(イベント、LiDAR)モダリティの寄与を効果的にバランスさせ、ガウスノイズおよびランダムノイズ下でもイベントおよびLiDARのmIoU値を高い水準で維持した。
  • アブレーションスタディにより、補助ヘッドとMoEルーティング機構が最終的な性能向上に著しく独立して寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。