[論文レビュー] Prototype-based Incremental Few-Shot Semantic Segmentation
本論文は、過去のデータにアクセスできないまま、少数のアノテート済み画像のみを用いて、事前学習済みセマンティックセグメンテーションモデルに新しいクラスを追加する、Incremental Few-Shot Semantic Segmentation (iFSS) という新しいタスクを導入する。提案手法PIFSは、分類器の初期化にプロトタイプ学習を、忘却と過学習の防止に知識蒸留を、非i.i.d.な少サンプルデータに対処するためバッチリノーマライゼーションを組み合わせ、複数のベンチマークで最先端の性能を達成する。
Semantic segmentation models have two fundamental weaknesses: i) they require large training sets with costly pixel-level annotations, and ii) they have a static output space, constrained to the classes of the training set. Toward addressing both problems, we introduce a new task, Incremental Few-Shot Segmentation (iFSS). The goal of iFSS is to extend a pretrained segmentation model with new classes from few annotated images and without access to old training data. To overcome the limitations of existing models iniFSS, we propose Prototype-based Incremental Few-Shot Segmentation (PIFS) that couples prototype learning and knowledge distillation. PIFS exploits prototypes to initialize the classifiers of new classes, fine-tuning the network to refine its features representation. We design a prototype-based distillation loss on the scores of both old and new class prototypes to avoid overfitting and forgetting, and batch-renormalization to cope with non-i.i.d.few-shot data. We create an extensive benchmark for iFSS showing that PIFS outperforms several few-shot and incremental learning methods in all scenarios.
研究の動機と目的
- 大規模なアノテート済みデータセットを必要とする従来のセマンティックセグメンテーションモデルの限界を解消し、再訓練なしに新しいクラスに適応できない問題に対処すること。
- 過去のデータにアクセスできない状況で、少数の画像から新しいクラスを学習するという実用的で新しい学習シナリオ—Incremental Few-Shot Segmentation (iFSS)—を定義すること。
- 最小限の監視情報で新しいクラスに効果的に適応しつつ、深刻な忘却を回避する手法を開発すること。
- 現実的な条件下で、既存および提案手法の評価と比較が可能な、包括的なiFSSベンチマークを設計すること。
提案手法
- PIFSは、新しいクラスの特徴のプロトタイプを用いて分類器の重みを初期化し、少サンプル学習中に効果的なエンドツーエンドのファインチューニングを可能にする。
- 旧クラスと新クラスのスコアを同時に正則化するプロトタイプベースの蒸留損失を導入し、忘却と過学習の両方を軽減する。
- 標準的なバッチノーマライゼーションの代わりにバッチリノーマライゼーションを採用することで、非i.i.d.な少サンプルデータ分布における学習を安定化させる。
- プロトタイプはサポート画像から計算され、特徴学習と分類を指導するためのクラス固有の埋め込みとして使用される。
- 学生ネットワーク(新クラスでファインチューニング済み)と教師ネットワーク(ベースクラスで事前学習済み)の間で知識蒸留を適用し、プロトタイプをソフトターゲットとして用いる。
- 過去に学習したクラスの性能を維持しながら、順次新しいクラスを追加できるインクリメンタル学習をサポートする。
実験結果
リサーチクエスチョン
- RQ1過去の学習データにアクセスできない状況で、少数のアノテート済み画像のみを用いてセマンティックセグメンテーションモデルを効果的に新しいクラスに拡張できるか?
- RQ2トレーニング中に旧クラスのデータが利用できない場合、少サンプルセマンティックセグメンテーションで深刻な忘却をどのように軽減できるか?
- RQ3セマンティックセグメンテーションにおいて、非i.i.d.な少サンプルデータ分布に対して最も効果的なトレーニング技術は何か?
- RQ4プロトタイプベースの初期化と知識蒸留を組み合わせることで、少サンプル一般化およびインクリメンタル学習の性能が向上するか?
- RQ5旧クラスのピxlsが背景としてラベル付けされる背景シフトがモデル性能に与える影響は何か? そして、その影響をどのように是正できるか?
主な発見
- PIFSは、VOCおよびCOCOベンチマークのすべてのiFSS設定において、平均交差率(mIoU)が最高を記録し、既存のインクリメンタルおよび少サンプル学習手法を上回る。
- 背景シフトを伴うシングルステップ設定において、PIFS*(改訂版交差エントロピー損失を適用)は、VOCで最良のIL手法より2.7%、COCOで4%高い調和平均(HM)mIoUを達成した。
- PIFS*は、PIFSに比べてVOCでmIoU-B(背景クラス)を1.7%、COCOで4.7%向上させ、背景シフトのモデル化の利点を示した。
- バッチリノーマライゼーションの使用は、非i.i.d.な少サンプルデータでは性能を低下させる標準バッチノーマライゼーションに比べ、顕著な性能向上をもたらした。
- 新クラスのプロトタイプのみに依存する手法(例:DWI)は、VOCで平均HMで5.7%、COCOで2.5%劣っており、共同蒸留の利点を示した。
- SPNは背景シフトを適切に処理できず、mIoU-Bスコアが低かったが、PIFS*はVOCで6%、COCOで2.7%優れており、適切な背景モデリングの重要性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。