[論文レビュー] Focus on Query: Adversarial Mining Transformer for Few-Shot Segmentation
本論文は、細粒度のサポート情報に依存するのではなく、クエリ特徴を精錬することに注力することで、最先端の性能を達成するクエリ中心の少数 shot 分割モデルである adversarial mining transformer (AMFormer) を提案する。粗いサポートラベルのみを用いても、76.8% の mIoU を達成する。このモデルは、グローバル拡張ネットワーク (G) とディテールマイニングネットワーク (D) の間で敵対的トレーニングを実施し、対象内類似度を用いて粗い予測を段階的に精錬する。
Few-shot segmentation (FSS) aims to segment objects of new categories given only a handful of annotated samples. Previous works focus their efforts on exploring the support information while paying less attention to the mining of the critical query branch. In this paper, we rethink the importance of support information and propose a new query-centric FSS model Adversarial Mining Transformer (AMFormer), which achieves accurate query image segmentation with only rough support guidance or even weak support labels. The proposed AMFormer enjoys several merits. First, we design an object mining transformer (G) that can achieve the expansion of incomplete region activated by support clue, and a detail mining transformer (D) to discriminate the detailed local difference between the expanded mask and the ground truth. Second, we propose to train G and D via an adversarial process, where G is optimized to generate more accurate masks approaching ground truth to fool D. We conduct extensive experiments on commonly used Pascal-5i and COCO-20i benchmarks and achieve state-of-the-art results across all settings. In addition, the decent performance with weak support labels in our query-centric paradigm may inspire the development of more general FSS models. Code will be available at https://github.com/Wyxdm/AMNet.
研究の動機と目的
- 現在の少数 shot 分割手法が、特にクラス内多様性が高い状況下で、細粒度のサポート情報に過度に依存しているという制限に対処すること。
- 正確なピクセル単位のサポート特徴ではなく、粗いカテゴリーレベルのサポートガイダンスのみで、クエリ画像の正確なセグメンテーションが可能かどうかを調査すること。
- 対象内類似度を活用して、不完全な活性化から完全なオブジェクトマスクを回復するクエリ中心の枠組みを構築すること。
- 正確なサポートアノテーションへの依存を低減し、弱いか incomplete なサポートラベルに強いモデルを設計すること。
- 局所的ディテール識別を用いて粗い予測を敵対的に精錬することで、セグメンテーション精度を向上させること。
提案手法
- 対象内特徴類似度を用いて、クエリ画像内の不完全でサポートによって活性化された領域を拡張するオブジェクトマイニングトランスフォーマー (G) を導入する。
- 拡張されたマスクと正例との間の局所的差異を特定することで精錬を誘導するディテールマイニングトランスフォーマー (D) を提案する。
- G が D をだませるよう敵対的トレーニングの目的関数を採用し、粗い予測から段階的な精錬を実現する。
- D において学習可能な局所プロキシを用いることで、オブジェクト境界などの曖昧領域に注目し、局所化精度を向上させる。
- G においてマルチスケール特徴集約を適用し、クエリ画像内のスケールが異なるオブジェクトに対応する。
- D において多様性損失 ($\mathcal{L}_{div}$) を適用することで、プロキシが同じ領域に収束するのを防ぎ、包括的な特徴カバレッジを確保する。
実験結果
リサーチクエスチョン
- RQ1細粒度のピクセル単位のサポート特徴ではなく、粗いカテゴリーレベルのサポートガイダンスのみで、少数 shot 分割モデルが高い性能を達成できるか?
- RQ2クラス内多様性が高い状況下で、マスク精錬をガイドする際、対象内類似度が対象間類似度やクラス内類似度に比べて優れているか?
- RQ3グローバル拡張ネットワークと局所的ディテール識別器の間で敵対的トレーニングを実施することで、細粒度のサポート監視に依存せずにセグメンテーション精度を向上させられるか?
- RQ4弱いサポートアノテーション(例:バウンディングボックス、スクラッチ)が、クエリ中心の FSS モデルの性能に与える影響は何か?
- RQ5マルチスケール特徴集約は、異なるオブジェクトスケールにわたるマスク予測のロバスト性をどのように向上させるか?
主な発見
- AMFormer は、1ショット設定において Pascal-5i ベンチマークで 76.8% の mIoU を達成し、新たな最先端の性能を記録した。
- 80% のサポート特徴が消去された状態でも、69.3% の mIoU を維持するなど、不完全なサポート情報に対して強いロバストネスを示した。
- ディテールマイニングトランスフォーマー (D) の追加により、G のみの性能から 1.2% mIoU の向上が得られ、多様性損失 ($\mathcal{L}_{div}$) がこの向上に不可欠であることが判明した。
- D において 10 個の局所プロキシを使用すると最適な性能が得られ、より多くのプロキシは冗長性のため、利得が減少した。
- Pascal-5i において、バウンディングボックスサポートでは 73.1% mIoU、スクラッチサポートでは 71.5% mIoU を達成し、弱い教師信号下でも実現可能性を示した。
- 可視化結果から、粗いガイダンスから生成された疑似サポート画像が、クエリ特徴とのずれが少ないため、実際のサポートよりも完全なオブジェクト属性を捉えていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。