Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Segmentation In-the-Wild Without Seeing Any Segmentation Examples

Nir Zabari, Yedid Hoshen|arXiv (Cornell University)|Dec 6, 2021
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本論文は、画像レベルのクラス記述からテスト時増強を用いて偽ラベルを生成することで、ピクセルレベルのアノテーションを一切用いずに高品質なセマンティックセグメンテーションマスクを生成するゼロショット手法を提案する。CLIPのビジョン・ランゲージ埋め込みを活用し、特にレアなカテゴリや未学習カテゴリにおいて、洗練された関連性マップを偽教師信号として用いることで、従来の弱教師あり手法を上回る性能を達成する。

ABSTRACT

Semantic segmentation is a key computer vision task that has been actively researched for decades. In recent years, supervised methods have reached unprecedented accuracy, however they require many pixel-level annotations for every new class category which is very time-consuming and expensive. Additionally, the ability of current semantic segmentation networks to handle a large number of categories is limited. That means that images containing rare class categories are unlikely to be well segmented by current methods. In this paper we propose a novel approach for creating semantic segmentation masks for every object, without the need for training segmentation networks or seeing any segmentation masks. Our method takes as input the image-level labels of the class categories present in the image; they can be obtained automatically or manually. We utilize a vision-language embedding model (specifically CLIP) to create a rough segmentation map for each class, using model interpretability methods. We refine the maps using a test-time augmentation technique. The output of this stage provides pixel-level pseudo-labels, instead of the manual pixel-level labels required by supervised methods. Given the pseudo-labels, we utilize single-image segmentation techniques to obtain high-quality output segmentation masks. Our method is shown quantitatively and qualitatively to outperform methods that use a similar amount of supervision. Our results are particularly remarkable for images containing rare categories.

研究の動機と目的

  • 各新しいクラスに対して膨大なピクセルレベルのアノテーションを必要とする教師ありセマンティックセグメンテーションの高コストかつスケーラビリティの制限を解消すること。
  • アノテートされたトレーニングデータが入手できないレアまたは未学習のオブジェクトカテゴリのセマンティックセグメンテーションを可能にすること。
  • 手動でのピクセルアノテーションを不要とし、画像レベルラベルと事前学習済みビジョン・ランゲージモデルのみを用いて正確なセグメンテーションマスクを生成する手法を開発すること。
  • 長尾分布や希少クラスの分布において、手動の教師信号を自動的に生成される偽ラベルに置き換えることで、性能を向上させること。

提案手法

  • 本手法は、各カテゴリを記述するテキストプロンプトと画像特徴間のアテンション活性化を解釈することで、CLIPを用いて各クラスごとの関連性マップを生成する。
  • ノイズの多い関連性マップの品質を向上させ、局所化精度を向上させるために、複数の画像ビュー(例:クロップ、フリップ、コントラスト変更)を用いたテスト時増強(TTA)を適用する。
  • 洗練された各クラスごとの関連性マップを統合し、マルチクラスセグメンテーションマップを作成し、これを下流のセグメンテーションモデルのピクセル単位の偽ラベルとして使用する。
  • これらの偽ラベルは、手動アノテーションの代わりに、非教師ありクラスタリングまたはインタラクティブセグメンテーションモデルの初期化に使用される。
  • ハードバイナリゼーションの代わりに確率的サンプリングを用いることで、関連性マップに内在する不確実性をより適切に扱い、セグメンテーション品質を向上させる。
  • 本手法は任意の単一画像セグメンテーションモデルと互換性があり、プラグイン型の偽教師信号モジュールとして機能する。

実験結果

リサーチクエスチョン

  • RQ1CLIPのようなビジョン・ランゲージモデルを、ピクセルレベルの教師信号なしに正確な偽セグメンテーションマスクを生成するために効果的に活用できるか?
  • RQ2テスト時増強は、CLIPのアテンションメカニズムから導出される関連性マップの品質をどのように向上させるか?
  • RQ3洗練されたCLIPベースの関連性マップは、単一画像セグメンテーションモデルに対する効果的な偽教師信号として機能するか?
  • RQ4本手法は、従来の弱教師ありまたは少サンプル手法と比較して、希少または長尾カテゴリにおいてどのように性能を発揮するか?
  • RQ5増強戦略、バイナリゼーション閾値、サンプリング手法といった設計選択肢の中で、セグメンテーション性能に最も大きな影響を与えるのはどれか?

主な発見

  • 本手法は、類似したレベルの教師信号を用いる他の手法と比較して、標準ベンチマークで優れた定量的性能を達成しており、特に希少カテゴリで顕著な優位性を示す。
  • テスト時増強はセグメンテーション品質を顕著に向上させ、クロップビューが最も寄与しており、すべてのビューを組み合わせることでさらに性能が向上する。
  • ハードバイナリゼーションに代えて確率的サンプリングを用いることで、CLIPの関連性マップに内在する不確実性とノイズをより適切に扱えるため、性能が向上する。
  • 3つの自動生成クリックを用いたインタラクティブセグメンテーションは、非教師ありクラスタリングを上回る結果を示し、両手法とも偽教師信号の恩恵を著しく受ける。
  • PASCAL VOCやレアなクラスを含む実世界の画像における定性的な結果から、本手法は希少かつユニークなカテゴリに対しても頑健であることが示された。
  • アブレーションスタディにより、CLIPベースの関連性マップ生成とTTAによる洗練が、高い性能を達成する上で不可欠な要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。