Skip to main content
QUICK REVIEW

[論文レビュー] MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation

Zizhang Li, Mengmeng Wang|arXiv (Cornell University)|Nov 21, 2021
Multimodal Machine Learning Applications参考文献 37被引用数 8
ひとこと要約

MaIL は、従来のエンコーダー=ファージョン=デコーダー パイプラインに代わる、統合的でマルチモーダル相互作用型のエンコーダーを備えた、マスク・画像・言語の3モーダル変換器ネットワークを提案する。画像、言語、インスタンス マスクの入力を同時に処理する深層モーダル相互作用エンコーダーにより、マスクを第1のモーダルティとして導入し、適応的選択戦略を用いることで、RefCOCO、RefCOCO+、G-Ref ベンチマークで 3%-10% の相対的向上を達成し、最先端の性能を実現した。

ABSTRACT

Referring image segmentation is a typical multi-modal task, which aims at generating a binary mask for referent described in given language expressions. Prior arts adopt a bimodal solution, taking images and languages as two modalities within an encoder-fusion-decoder pipeline. However, this pipeline is sub-optimal for the target task for two reasons. First, they only fuse high-level features produced by uni-modal encoders separately, which hinders sufficient cross-modal learning. Second, the uni-modal encoders are pre-trained independently, which brings inconsistency between pre-trained uni-modal tasks and the target multi-modal task. Besides, this pipeline often ignores or makes little use of intuitively beneficial instance-level features. To relieve these problems, we propose MaIL, which is a more concise encoder-decoder pipeline with a Mask-Image-Language trimodal encoder. Specifically, MaIL unifies uni-modal feature extractors and their fusion model into a deep modality interaction encoder, facilitating sufficient feature interaction across different modalities. Meanwhile, MaIL directly avoids the second limitation since no uni-modal encoders are needed anymore. Moreover, for the first time, we propose to introduce instance masks as an additional modality, which explicitly intensifies instance-level features and promotes finer segmentation results. The proposed MaIL set a new state-of-the-art on all frequently-used referring image segmentation datasets, including RefCOCO, RefCOCO+, and G-Ref, with significant gains, 3%-10% against previous best methods. Code will be released soon.

研究の動機と目的

  • 従来のバイモーダル エンコーダー=ファージョン=デコーダー パイプラインの限界、特に不十分なクロスモーダル相互作用と、不一致する事前学習タスクを解消すること。
  • しばしば従来の手法で未活用されているインスタンスレベル特徴を明示的にモデル化することで、セグメンテーション精度を向上させること。
  • 単一モーダル特徴抽出とクロスモーダル ファージョンを1つの深層モーダル相互作用エンコーダーに統合し、独立した単一モーダル事前学習エンコーダーの必要性を排除すること。
  • 事前セグメンテーションされたインスタンス マスクを第3のモーダルティとして導入することで、微細な局所化性能を向上させることの有効性を検証すること。
  • デコーダーに選択的マスク ファージョン機構を構築し、予測を精緻化するために最も関連性の高いマスク表現を適応的に選択すること。

提案手法

  • 画像、言語、マスク特徴を1つの深層モーダル相互作用トランスフォーマー エンコーダー内で同時に処理する統合的エンコーダー=デコーダー アーキテクチャを提案する。
  • インスタンス マスクを専用のモーダルティとして導入し、画像、言語、マスクの3モーダルティ間で低レベルおよび高レベル特徴の両方で明示的なクロスモーダル相互作用を可能にする。
  • 単一モーダル エンコーダーを統合的モーダル相互作用メカニズムに置き換えることで、アーキテクチャの複雑さを低減し、モーダルティの整合性を向上させる。
  • デコーダーで適応的マスク選択戦略を採用し、K 個の候補マスクの中からスコアが最も高いマスク表現を選択して最終的なセグメンテーション出力を精緻化する。
  • 統合的エンコーダーにマルチモーダル事前学習重みを適用し、ターゲットのマルチモーダル タスクと表現を一致させ、単一モーダル事前学習による不整合を回避する。
  • エンコーダーで全3モーダルティにわたる学習可能なアテンション メカニズムを適用し、動的で多段階の特徴相互作用を可能にし、表現品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1従来のエンコーダー=ファージョン=デコーダー パイプラインを統合的モーダル相互作用エンコーダーに置き換えることで、参照画像セグメンテーションの性能が向上するか?
  • RQ2インスタンス マスクを第1のモーダルティとして導入することで、インスタンスレベル特徴の学習が向上し、より微細なセグメンテーション結果が得られるか?
  • RQ3単純なプーリングや重み付き和の手法と比較して、適応的マスク選択戦略は関連するマスク特徴をどれほど効果的に選択できるか?
  • RQ4マスククロップド画像(全画像ではなくマスク領域に限定された画像)を使用する場合、背景情報や位置的情報の有効性はどの程度影響を受けるか?
  • RQ5統合的トリモーダル フレームワークは、多様な参照画像セグメンテーションベンチマークで、従来のバイモーダル手法を上回る性能を発揮できるか?

主な発見

  • MaIL は、RefCOCO、RefCOCO+、G-Ref ベンチマークで最先端の性能を達成し、前人最高の手法と比較して 3%-10% の相対的向上を示した。
  • マスクを別モーダルティとして導入することで、バイモーダルベースラインと比較して 2.89% の IoU 向上を達成し、明示的なインスタンスレベル特徴モデリングの利点を実証した。
  • マスククロップド画像(バージョン2)を用いることで、背景コンテキストの喪失と事前セグメンテーションマスク品質への依存性が原因で、顕著な性能低下が生じた。
  • 提案された適応的マスク選択戦略は、マスク特徴を一切使用しない場合に比べ 2.57% の向上を達成し、平均値、最大値、重み付き和プーリング戦略を上回った。
  • 可視化結果から、選択されたマスクが参照対象と強く関連しており、事前生成マスクの欠陥(余分なセグメントなど)を修正する最終予測が得られていることが確認された。
  • 深層モーダル相互作用を備えた統合的エンコーダー=デコーダー パイプラインは、従来の2段階ファージョン手法に比べ、より効果的なクロスモーダル表現学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。