[論文レビュー] Fully Self-Supervised Learning for Semantic Segmentation
本稿では、画像分類のImageNet事前学習モデルに依存しない完全自己教師ありフレームワークである$FS^{4}$を提案する。ピラミッド型グローバルガイドド(PGG)疑似ラベル付けとコンテキスト対応埋め込み(CAE)を導入することで、ピクセルクラスタリングの安定化を図った。COCO-Stuffで14.76 mIoUを達成し、先行する自己教師あり手法を7 mIoU以上上回り、完全教師あり事前学習の性能に匹敵する。
In this work, we present a fully self-supervised framework for semantic segmentation(FS^4). A fully bootstrapped strategy for semantic segmentation, which saves efforts for the huge amount of annotation, is crucial for building customized models from end-to-end for open-world domains. This application is eagerly needed in realistic scenarios. Even though recent self-supervised semantic segmentation methods have gained great progress, these works however heavily depend on the fully-supervised pretrained model and make it impossible a fully self-supervised pipeline. To solve this problem, we proposed a bootstrapped training scheme for semantic segmentation, which fully leveraged the global semantic knowledge for self-supervision with our proposed PGG strategy and CAE module. In particular, we perform pixel clustering and assignments for segmentation supervision. Preventing it from clustering a mess, we proposed 1) a pyramid-global-guided (PGG) training strategy to supervise the learning with pyramid image/patch-level pseudo labels, which are generated by grouping the unsupervised features. The stable global and pyramid semantic pseudo labels can prevent the segmentation from learning too many clutter regions or degrading to one background region; 2) in addition, we proposed context-aware embedding (CAE) module to generate global feature embedding in view of its neighbors close both in space and appearance in a non-trivial way. We evaluate our method on the large-scale COCO-Stuff dataset and achieved 7.19 mIoU improvements on both things and stuff objects
研究の動機と目的
- ImageNet事前学習モデルへの依存を完全に排除した完全自己教師ありセマンティックセグメンテーションを実現すること。
- 自己教師あり事前学習におけるグローバルな意味的ガイダンスの欠如に起因するピクセルレベルのクラスタリングの不安定性を解消すること。
- 生画像から自動的にセマンティックカテゴリを発見するブートストラップ訓練パイプラインを構築すること。
- グローバル画像レベルの疑似ラベルとコンテキスト対応特徴学習を活用することで、自己教師ありセグメンテーションのロバスト性と性能を向上させること。
- ゼロショット、オープンワールドのセグメンテーション設定において、完全教師あり事前学習の性能に達するか、それを上回ること。
提案手法
- 2段階の訓練パイプラインを提案:まず、インスタンスレベル自己教師あり(ISS)特徴を用いた画像レベルクラスタリングにより、ピラミッドレベルの疑似ラベルを生成する。
- 複数スケールの画像レベル疑似ラベルをグローバルな監視として用い、ピクセルレベルのクラスタリングに適用するピラミッド型グローバルガイドド(PGG)戦略を導入する。
- 隣接する特徴間の空間的・外観的類似性を非自明な方法でモデル化するコンテキスト対応埋め込み(CAE)モジュールを設計する。
- グローバル特徴から生成された疑似ラベルを用いたピクセルクラスタリングにより、ブートストラップ方式でセグメンテーションヘッドをエンドツーエンドに訓練する。
- 局所的コンテキストに注目し、空間的・外観的一貫性を保つために、CAEにおけるCAM構造を変更して特徴表現を強化する。
- 1枚の画像に対して1つ以上の疑似ラベルを用いたグローバルガイダンス損失を適用し、クラスタリングの安定化と過剰分割・バックグラウンドの崩壊を防止する。
実験結果
リサーチクエスチョン
- RQ1自己教師ありセマンティックセグメンテーションを、人為的アノテーション(含む事前学習)を一切使用せずに、完全にスクラッチから訓練可能か?
- RQ2自己教師あり事前学習から得られるグローバル意味的知識を、不安定なピクセルレベルクラスタリングを安定化させるために効果的に活用できるか?
- RQ3多スケールの画像レベル監視が、自己教師ありピクセルクラスタリングの品質向上に果たす役割は何か?
- RQ4コンテキスト対応特徴学習は、自己教師ありセグメンテーションのロバスト性と精度をどのように向上させるか?
- RQ5完全自己教師あり手法が、完全教師ありImageNet重みで初期化されたモデルと同等の性能を達成できるか?
主な発見
- 提案された$FS^{4}$フレームワークは、インスタンスレベル自己教師あり事前学習のみを用いてスクラッチから訓練した場合、COCO-Stuffで14.76 mIoUを達成し、先行する自己教師あり手法を7 mIoU以上上回った。
- ピラミッドレベルの疑似ラベルを用いたPGG戦略は、単一の画像レベル疑似ラベル付けと比較してmIoUを1.83ポイント向上させ、ごみやバックグラウンドの過剰分割を顕著に低減した。
- CAEモジュールの貢献は顕著であり、低レベル特徴のみの場合の12.01から、完全CAEを用いた場合の14.76にまでmIoUが上昇し、局所的および高レベルのコンテキストを併存してモデル化する重要性が示された。
- グローバルクラスタ数の変動に対しても安定した性能を示し、25~100クラスタの範囲で安定した性能を発揮。COCO-Stuffでは25クラスタで13.11 mIoUのピークを記録した。
- 完全教師ありImageNetモデルで初期化した場合でも、$FS^{4}$は15.69 mIoUを達成し、同じ設定下でPiCIEが得た上限の14.36 mIoUにほぼ達した。これは、強力な一般化性能を示している。
- アブレーションスタディの結果、COCO-stuff微調整、GG、CAE、PGG、Modの各コンポonentが性能向上に段階的に寄与しており、特にPGGとCAEが最大の向上をもたらした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。