[論文レビュー] Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning
本稿では、固定された事前学習済みRGBモデルを二重プロンプト学習を用いて適応することで、訓練に費やすコストが低いマルチモーダル意味セグメンテーションフレームワーク、DPLNetを提案する。軽量なマルチモーダルプロンプト生成器(MPG)とマルチモーダル特徴適応器(MFA)を導入することで、DPLNetは4つのRGB-D/Tベンチマークで最先端の性能を達成した。トレーニング可能なパラメータはたった388万(バックボーンの4.4%)であり、訓練コストとデプロイ負荷を顕著に低減した。
Multimodal (e.g., RGB-Depth/RGB-Thermal) fusion has shown great potential for improving semantic segmentation in complex scenes (e.g., indoor/low-light conditions). Existing approaches often fully fine-tune a dual-branch encoder-decoder framework with a complicated feature fusion strategy for achieving multimodal semantic segmentation, which is training-costly due to the massive parameter updates in feature extraction and fusion. To address this issue, we propose a surprisingly simple yet effective dual-prompt learning network (dubbed DPLNet) for training-efficient multimodal (e.g., RGB-D/T) semantic segmentation. The core of DPLNet is to directly adapt a frozen pre-trained RGB model to multimodal semantic segmentation, reducing parameter updates. For this purpose, we present two prompt learning modules, comprising multimodal prompt generator (MPG) and multimodal feature adapter (MFA). MPG works to fuse the features from different modalities in a compact manner and is inserted from shadow to deep stages to generate the multi-level multimodal prompts that are injected into the frozen backbone, while MPG adapts prompted multimodal features in the frozen backbone for better multimodal semantic segmentation. Since both the MPG and MFA are lightweight, only a few trainable parameters (3.88M, 4.4% of the pre-trained backbone parameters) are introduced for multimodal feature fusion and learning. Using a simple decoder (3.27M parameters), DPLNet achieves new state-of-the-art performance or is on a par with other complex approaches on four RGB-D/T semantic segmentation datasets while satisfying parameter efficiency. Moreover, we show that DPLNet is general and applicable to other multimodal tasks such as salient object detection and video semantic segmentation. Without special design, DPLNet outperforms many complicated models. Our code will be available at github.com/ShaohuaDong2021/DPLNet.
研究の動機と目的
- マルチモーダル意味セグメンテーションのための従来の二重ブランチエンコーダ・デコーダモデルにおける高い訓練コストとパラメータ非効率性を解決すること。
- パラメータ数を減らしつつも、パフォーマンスを維持または向上させるマルチモーダル特徴統合と適応のためのパラメータ数を削減すること。
- 事前学習済みRGBバックボーンを固定し、軽量モジュールのみを追加することで、デプロイに適したモデルを実現すること。
- 提案手法を、顕著オブジェクト検出や動画意味セグメンテーションなどの他のマルチモーダル密度予測タスクへ一般化すること。
- 完全な微調整を伴わずに、RGBと補助モダリティ(例:深度、赤外)の間のドメインギャップを効果的に緩和するプロンプトベースの適応手法を克服すること。
提案手法
- 複数の段階で固定されたバックボーンに、異なるモダリティ(例:RGBと深度/赤外)の特徴を統合するマルチモーダルプロンプト生成器(MPG)を導入し、マルチレベルのマルチモーダルプロンプトを生成する。
- 浅い段階から深い段階へと順次MPGモジュールを挿入することで、固定されたエンコーダーにモダリティ補完特徴を組み込む。
- 学習可能なトークンとクロスアテンションを用いて、固定されたバックボーンをマルチモーダル入力に適応させるマルチモーダル特徴適応器(MFA)を設計する。これにより、特徴表現が向上する。
- 各段階にMFAを適用することで、モダリティ固有の特徴と固定ネットワークとの間で効果的な相互作用を実現し、統合されたマルチモーダル特徴を精緻化する。
- 追加のパラメータオーバーヘッドを最小限に抑えるために、シンプルで軽量なデコーダ(327万パラメータ)を採用し、セグメンテーションマスクを生成する。
- 事前学習済みRGBバックボーンを固定したまま、MPGとMFAモジュール(388万パラメータ)のみをトレーニングすることで、パラメータ効率性を実現する。
実験結果
リサーチクエスチョン
- RQ1固定された事前学習済みRGBモデルを、最小限のパラメータ更新でマルチモーダル意味セグメンテーションに効果的に適応できるか?
- RQ2マルチモーダルプロンプト生成器と特徴適応器を備えた二重プロンプト学習フレームワークが、複雑な完全微調整型二重ブランチアーキテクチャを上回る精度と効率性を達成できるか?
- RQ3MPGおよびMFAモジュールの配置と設計が、さまざまな意味セグメンテーションベンチマークにおけるパフォーマンスに与える影響は何か?
- RQ4提案手法は意味セグメンテーションを越えて、顕著オブジェクト検出や動画セグメンテーションなどの他のマルチモーダル密度予測タスクへ一般化可能か?
- RQ5完全な微調整を伴わずに、プロンプトベースの適応が、RGBと補助モダリティ(例:深度、赤外)の間のドメインギャップをどの程度緩和できるか?
主な発見
- DPLNetは、388万のトレーニング可能なパラメータで、4つのRGB-D/T意味セグメンテーションベンチマーク(NYUDv2、NYUv2、S3DIS、およびRGB-T SOD)で最先端または競争力のあるパフォーマンスを達成した。
- NYUDv2では、DPLNetが0.583 mIoUを達成し、完全微調整ベースライン(0.581 mIoU)を上回ったが、パラメータ効率性が著しく優れていた。
- アブレーションスタディの結果、MPGとMFAの両方が不可欠であることが確認された。両方を削除するとmIoUが0.9%低下し、最適なパフォーマンスは30個の学習可能なトークンと32次元のプロンプトで達成された。
- DPLNetは他のマルチモーダルタスクへも効果的に一般化された:5つのRGB-D顕著オブジェクト検出ベンチマークで最先端のパフォーマンスを発揮し、RGB-T動画意味セグメンテーションでもMVNetを上回った(0.579 mIoU 対 0.545 mIoU)、トレーニング可能なパラメータは12倍少ない。
- 単一フレーム入力のみを用いても、時間的モデリングを用いる手法と比較して、動画意味セグメンテーションで優れたパフォーマンスを発揮した。これは、強力な一般化能力と効率性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。