Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Semantic Segmentation with Self-supervision from Pseudo-classes

Yiwen Li, Gratianus Wesley Putra Data|arXiv (Cornell University)|Oct 22, 2021
Domain Adaptation and Few-Shot Learning参考文献 29被引用数 9
ひとこと要約

本論文は、クエリ画像の背景における高活性化スーパーピクセルから擬似クラスを生成することで、未学習クラスへの一般化を向上させる自己教師付き少数ショットセマンティックセグメンテーション手法を提案する。これらの擬似クラスを背景から区別するようにモデルを訓練することで、顕著な性能向上が達成され、COCO 5ショットでは最大6.7%、PASCAL-5i 1ショットでは5.1%のmIoU向上を達成した。特に複数のオブジェクトクラスを含む画像において、セグメンテーション精度が顕著に向上した。

ABSTRACT

Despite the success of deep learning methods for semantic segmentation, few-shot semantic segmentation remains a challenging task due to the limited training data and the generalisation requirement for unseen classes. While recent progress has been particularly encouraging, we discover that existing methods tend to have poor performance in terms of meanIoU when query images contain other semantic classes besides the target class. To address this issue, we propose a novel self-supervised task that generates random pseudo-classes in the background of the query images, providing extra training data that would otherwise be unavailable when predicting individual target classes. To that end, we adopted superpixel segmentation for generating the pseudo-classes. With this extra supervision, we improved the meanIoU performance of the state-of-the-art method by 2.5% and 5.1% on the one-shot tasks, as well as 6.7% and 4.4% on the five-shot tasks, on the PASCAL-5i and COCO benchmarks, respectively.

研究の動機と目的

  • クエリ画像にターゲットクラス以外の複数のオブジェクトクラスが存在する場合に、少数ショットセマンティックセグメンテーションの性能が低下することを解消すること。
  • 既存の少数ショットセグメンテーション手法が非ターゲットピクセルを均一な背景として扱うため、背景クラスの監督信号が不足している問題を軽減すること。
  • クエリ画像の背景のスーパーピクセルセグメンテーションから導出された擬似クラスから自己教師付きトレーニング信号を導入することで、モデルの一般化性能を向上させること。
  • 非ターゲットクラスを区別する学習が、特徴の分離性を向上させ、未学習クラスにおけるセグメンテーション精度を向上させることを示すこと。
  • トレーニング中にテストクラスのピクセルをマスクすることで、本手法の新規クラスに対するロバスト性を検証し、性能低下を最小限に抑えること。

提案手法

  • 本手法は、特徴マップからの高い活性化スコアを持つクエリ画像の背景におけるスーパーピクセルを特定することで、擬似クラスを生成する。
  • 各エピソードにおいて、活性化値が最も高い上位5つのスーパーピクセルを用いて擬似クラスを形成し、自己教師付き学習用の追加の画像-マスクペアを生成する。
  • 自己教師付き損失は、可学習ハイパーパrameter α によってスケーリングされ、擬似監督と真値監督のバランスをとる。
  • モデルは、ターゲットクラスにおける標準的なセグメンテーション損失と、擬似クラスにおける自己教師付き損失の両方を用いて訓練される。
  • スーパーピクセルセグメンテーションを用いることで、ランダムなピクセルサンプリングと比較して、空間的整合性を高め、過剰セグメンテーションのアーティファクトを低減する。
  • 本手法はアーキテクチャに依存せず、PFENet や PANet などの任意の少数ショットセグメンテーションモデルに、自己教師付きヘッドを追加することで適用可能である。

実験結果

リサーチクエスチョン

  • RQ1クエリ画像に複数のオブジェクトクラスが存在することで、少数ショットセマンティックセグメンテーションの性能が低下するのか。その理由は何か?
  • RQ2背景のスーパーピクセルから導出された自己教師付き擬似クラスは、未学習クラスへの一般化性能を向上させることができるか?
  • RQ3擬似クラスのサンプリング戦略(例:上位1、上位5、ランダム)の選択が、性能とロバスト性に与える影響は何か?
  • RQ4サポートセットに存在しない非ターゲットクラスを区別する学習が、どれほどモデルの性能向上に寄与するか?
  • RQ5トレーニング中にそのクラスのピクセルがマスクされた完全に新しいクラスに対しても、自己教師付き信号が一般化可能か?

主な発見

  • 提案手法は、最先端の PFENet と比較して、PASCAL-5i 1ショットベンチマークで5.1%、COCO 5ショットベンチマークで6.7%のmIoU向上を達成した。
  • 上位5つのスーパーピクセルをサンプリングする戦略が、上位1やランダムサンプリングを上回り、ResNet-50 PFENet を用いたPASCAL-5i 1ショットで63.2%のmIoUを達成した。
  • トレーニング中にテストクラスのピクセルをマスクしても、PFENet では性能がたった0.4%低下にとどまり、未学習クラスへの一般化性能が非常に高いことが示された。
  • 最適な自己教師付き損失スケーリング係数 α は 0.5 であることが判明し、偽ラベルの不正確さと有効な監督のバランスをとることができた。
  • 本手法はクラス間の性能の不均衡を軽減し、埋め込み空間における特徴の分離性を向上させた。
  • アブレーションスタディの結果、性能向上はテストクラスとのデータリークや重複によるものではなく、背景表現の学習が改善されたことによるものであると確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。