Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Segmentation with Optimal Transport Matching and Message Flow

Weide Liu, Chi Zhang|arXiv (Cornell University)|Aug 19, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、部分最適輸送マッチングを用いてクエリとサポート特徴間の密で制約付きの対応関係を確立するとともに、メッセージフローモジュールを用いて局所的およびグローバルな特徴表現を強化する、少数ショットセグメンテーションモデルCMNetを提案する。本手法は、標準的および弱教師あり設定の両方において、PASCAL VOC 2012、MS COCO、FSS-1000で最先端の性能を達成した。

ABSTRACT

We tackle the challenging task of few-shot segmentation in this work. It is essential for few-shot semantic segmentation to fully utilize the support information. Previous methods typically adopt masked average pooling over the support feature to extract the support clues as a global vector, usually dominated by the salient part and lost certain essential clues. In this work, we argue that every support pixel's information is desired to be transferred to all query pixels and propose a Correspondence Matching Network (CMNet) with an Optimal Transport Matching module to mine out the correspondence between the query and support images. Besides, it is critical to fully utilize both local and global information from the annotated support images. To this end, we propose a Message Flow module to propagate the message along the inner-flow inside the same image and cross-flow between support and query images, which greatly helps enhance the local feature representations. Experiments on PASCAL VOC 2012, MS COCO, and FSS-1000 datasets show that our network achieves new state-of-the-art few-shot segmentation performance.

研究の動機と目的

  • 従来の少数ショットセグメンテーション手法がサポート特徴のグローバル平均プーリングに依存する点(空間的構造が失われ、判別性が低い部分が無視される)を是正する。
  • 従来手法に見られる多対一マッチング問題を克服するため、クエリとサポート特徴間の制約付き多対多対応を可能にする。
  • 局所的特徴表現を向上させるために、画像内(インナーフロー)および画像間(クロスフロー)の両方の情報伝搬を可能にするメッセージフローモジュールを導入する。
  • バウンディングボックスアノテーションなどの限られたアノテーションタイプでも高い精度を維持できるようにすることで、弱教師あり設定における少数ショットセグメンテーション性能を向上させる。
  • 曖昧なまたは見た目が似た物体に対して頑健であることを保証するため、失敗事例の検証とモデルの限界の分析を行う。

提案手法

  • 真値のオブジェクトサイズに基づいて最大マッチングフローを制約する部分最適輸送(POT)マッチングモジュールを提案し、クエリとサポート特徴間のよりバランスの取れた包括的な対応関係を実現する。
  • クエリとサポート特徴をグラフとしてモデル化し、エッジに沿ってメッセージを伝搬することで、局所的表現を内側(インナーフロー)および画像間(クロスフロー)のメカニズムで精緻化するメッセージフローモジュールを導入する。
  • 空間的アライメントと対応関係の正確性を向上させるために、特徴表現に位置符号化を統合する。
  • クロスアテンションと特徴精錬を用いた二本のブランチからなるエンコーダ・デコーダアーキテクチャを採用し、マッチング済みかつ伝搬された特徴を用いてセグメンテーション予測をガイドする。
  • 事前にマスクを適用した後にPOTモジュールを適用することで、完全な最適輸送によるノイズや誤った対応関係への過学習を回避する。
  • ピクセルレベルのサポートアノテーションをバウンディングボックスに置き換えることで弱教師あり設定を検証し、粗い監督下でも頑健であることを示す。

実験結果

リサーチクエスチョン

  • RQ1部分最適輸送のような制約付き多対多マッチング機構は、グローバルプーリングや非制約付きマッチングと比較して、少数ショットセグメンテーションにおける対応関係学習を改善できるか?
  • RQ2局所的およびグローバルな特徴空間におけるメッセージ伝搬は、判別性が低いオブジェクト部品のセグメンテーション精度をどのように向上させるか?
  • RQ3位置符号化を組み込むことで、少数ショット設定における空間的アライメントとセグメンテーション性能が向上するか?
  • RQ4サポートアノテーションがピクセルレベルのマスクからバウンディングボックスに制限された場合でも、提案手法が高い性能を維持できるか?
  • RQ5モデルの失敗モードは、視覚的類似性やクエリ画像における意味的文脈の欠如とどのように関連しているか?

主な発見

  • CMNetはPASCAL VOC 2012で新たな最先端性能を達成し、1ショット設定下で62.5%のmIoUを記録。PGNet(61.7% mIoU)を上回った。
  • MS COCOデータセットでは、1ショットおよび5ショット設定の両方で、従来の最先端手法すべてを上回る最高性能を達成した。
  • FSS-1000ベンチマークでは、1ショットおよび5ショット評価プロトコルの両方で、新たな最先端結果を樹立した。
  • アブレーションスタディの結果、位置符号化が0.4 mIoU向上させ、PASCAL VOC 2012の1ショット評価下で62.1%から62.5%に向上した。
  • 完全な最適輸送マッチングを用いることで性能が低下した。これは、制約付きマッチングが誤った対応関係(例えば、背景領域とのマッチング)を回避できることを示している。
  • バウンディングボックスをサポートアノテーションとして用いる弱教師あり設定でも、PASCAL VOC 2012およびFSS-1000の両方で既存手法を上回り、低スケールの監視下でも優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。