[論文レビュー] Weak-shot Semantic Segmentation via Dual Similarity Transfer
本稿では、ベースクラスのピクセルレベルのアノテーションと、新しいクラスの画像レベルラベルを活用することで、弱教師ありセマンティックセグメンテーションのための二重類似度転送フレームワーク、SimFormerを提案する。ベースクラスから新しいクラスへと提案-ピクセル類似度を転送し、クラスに依存しないピクセル-ピクセル類似度を蒸留することで、完全な教師信号がなくても正確なマスク予測が可能となり、COCO-Stuff-10KおよびADE20Kで最先端の性能を達成する。
Semantic segmentation is an important and prevalent task, but severely suffers from the high cost of pixel-level annotations when extending to more classes in wider applications. To this end, we focus on the problem named weak-shot semantic segmentation, where the novel classes are learnt from cheaper image-level labels with the support of base classes having off-the-shelf pixel-level labels. To tackle this problem, we propose SimFormer, which performs dual similarity transfer upon MaskFormer. Specifically, MaskFormer disentangles the semantic segmentation task into two sub-tasks: proposal classification and proposal segmentation for each proposal. Proposal segmentation allows proposal-pixel similarity transfer from base classes to novel classes, which enables the mask learning of novel classes. We also learn pixel-pixel similarity from base classes and distill such class-agnostic semantic similarity to the semantic masks of novel classes, which regularizes the segmentation model with pixel-level semantic relationship across images. In addition, we propose a complementary loss to facilitate the learning of novel classes. Comprehensive experiments on the challenging COCO-Stuff-10K and ADE20K datasets demonstrate the effectiveness of our method. Codes are available at https://github.com/bcmi/SimFormer-Weak-Shot-Semantic-Segmentation.
研究の動機と目的
- セマンティックセグメンテーションにおけるピクセルレベルマスクの高コストなアノテーションを軽減するため、より安価な画像レベルラベルからの新しいクラスの学習を可能にすること。
- 従来の手法がバックグラウンドクラスのマスクを必要としたり、市販のデータセットで新しいクラスを除外するという制限を克服すること。
- 実世界の応用におけるデータセット拡張のための実用的でスケーラブルなフレームワークの開発。
- 類似度転送と構造的正則化を通じて、新しいクラスのマスク品質の向上。
提案手法
- MaskFormerを変更し、セマンティックセグメンテーションを提案分類と提案セグメンテーションの2つのサブタスクに分離する。
- ベースクラスから新しいクラスへと提案-ピクセル類似度を転送し、真のマスクがなくてもマスク予測を可能にする。
- ベースクラスからクラスに依存しないピクセル-ピクセル類似度を学習・蒸留し、画像間のセマンティック関係を正則化する。
- 新しいクラスの提案の正しい割り当てを促進することで、マスク学習を強化する補完的損失を導入する。
- 参照画像とクエリ画像間のピクセルレベル類似度を推定するための学習可能な類似度ネットワーク(SimNet)を用いる。
- ピクセル-ピクセル類似度をベースクラスから新しいクラスへ転送するための知識蒸留を適用し、一般化性能とロバストネスを向上させる。
実験結果
リサーチクエスチョン
- RQ1ベースクラスから新しいクラスへの提案-ピクセル類似度転送が、画像レベルの監視のみで新しいクラスのマスクを効果的に予測できるか?
- RQ2ベースクラスから学習したクラスに依存しないピクセル-ピクセル類似度が、新しいクラスのセグメンテーション品質と一般化性能を向上させられるか?
- RQ3弱教師あり設定において、二重類似度転送が単一監視またはベースライン少数ショット手法と比較してどのように優れているか?
- RQ4補完的損失が新しいクラスのマスク学習およびモデルのロバストネスに与える影響は何か?
- RQ5より多くの新しいクラスに拡張する場合や、実世界のデータセット拡張シナリオにおいて、この手法の一般化性能はどの程度か?
主な発見
- SimFormerは、COCO-Stuff-10KおよびADE20Kで最先端の性能を達成し、既存の弱教師ありおよび少数ショット手法を上回る。
- 補完的損失のみでCOCO-Stuff-10KでmIoUが1.8%向上し、新しいクラスのマスク学習をガイドする有効性が示された。
- 二重類似度転送(提案-ピクセルおよびピクセル-ピクセル)により、ベースライン手法と比較してCOCO-Stuff-10KでmIoUが3.2%向上した。
- ハイパーパrameter β および γ に対してロバストであり、妥当な範囲の値で性能が安定している。
- 可視化結果から、転送されたピクセル-ピクセル類似度が、小さな物体や細分化された物体に対しても意味のあるセマンティック関係を捉えていることが確認された。
- 失敗事例から、細分化されたクラスにおける提案分類の限界や、小さな物体に対する弱教師信号の不十分さが明らかとなり、注意機構や局所化の改善の余地があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。