Skip to main content
QUICK REVIEW

[論文レビュー] DiffusePast: Diffusion-based Generative Replay for Class Incremental Semantic Segmentation

Jingfan Chen, Yuxi Wang|arXiv (Cornell University)|Aug 2, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

本稿では、クラス増分セマンティックセグメンテーションにおける災害的忘却を軽減し、マスク精度を向上させる、拡散モデルに基づくジェネレーティブリプレイフレームワーク「DiffusePast」を提案する。二重ジェネレータアーキテクチャ(分布整合型拡散リプレイ:DDR、構造保持型拡散リプレイ:SDR)を活用することで、高精細で意味的に正確な画像と信頼性の高い疑似マスクを生成し、VOC 15-5およびADE20K 50-50ベンチマークで最先端の性能を達成する。

ABSTRACT

The Class Incremental Semantic Segmentation (CISS) extends the traditional segmentation task by incrementally learning newly added classes. Previous work has introduced generative replay, which involves replaying old class samples generated from a pre-trained GAN, to address the issues of catastrophic forgetting and privacy concerns. However, the generated images lack semantic precision and exhibit out-of-distribution characteristics, resulting in inaccurate masks that further degrade the segmentation performance. To tackle these challenges, we propose DiffusePast, a novel framework featuring a diffusion-based generative replay module that generates semantically accurate images with more reliable masks guided by different instructions (e.g., text prompts or edge maps). Specifically, DiffusePast introduces a dual-generator paradigm, which focuses on generating old class images that align with the distribution of downstream datasets while preserving the structure and layout of the original images, enabling more precise masks. To adapt to the novel visual concepts of newly added classes continuously, we incorporate class-wise token embedding when updating the dual-generator. Moreover, we assign adequate pseudo-labels of old classes to the background pixels in the new step images, further mitigating the forgetting of previously learned knowledge. Through comprehensive experiments, our method demonstrates competitive performance across mainstream benchmarks, striking a better balance between the performance of old and novel classes.

研究の動機と目的

  • GANベースのジェネレーティブリプレイに起因する、災害的忘却および劣悪な疑似マスク品質の問題を解消すること。
  • GANベース手法の限界(語彙外のコンセプトや凍結されたジェネレータに起因する意味的不正確さや分布不一致)を克服すること。
  • 拡散モデルを用いて、再生成画像およびその対応する疑似ラベルの忠実性と意味的一致性を向上させること。
  • 新規の視覚的コンセプトに適応しつつ、古いクラスの知識を維持すること。
  • 新規に生成された画像の背景画素に疑似ラベルを割り当てることで、モデルの汎化性能を向上させること。

提案手法

  • 二重ジェネレータフレームワークを導入:旧クラスのデータ分布に一致させる分布整合型拡散リプレイ(DDR)と、空間的レイアウトおよびマスク構造を保持する構造保持型拡散リプレイ(SDR)を採用。
  • 完全な微調整を回避しつつ、新規の視覚的コンセプトに適応するため、クラスごとのトークン埋め込みを用いて事前学習済みStable Diffusionを更新。
  • テキストプロンプトまたはエッジマップを条件付き入力として用い、元のデータと意味的に整合する画像生成を促進。
  • 生成画像の背景画素に疑似ラベルを割り当てることで、旧クラスと新クラスの区別を強化。
  • 旧クラスのログティトおよび背景ログティトの両方に対して、交差エントロピーとログティト distillation を用いた知識蒸留を実施し、学習の安定化を図る。
  • 実際の応用では、DDRとSDRのサンプルを0.8の比率で統合し、分布整合性と構造的忠実性のバランスをとる。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルベースのジェネレーティブリプレイは、GANベースの手法に比べ、CISSにおける意味的に正確な画像および高精度な疑似マスクの生成を上回ることができるか?
  • RQ2二重ジェネレータ設計(DDRとSDR)は、再生成画像における分布整合性と構造的保持性をどのように向上させるか?
  • RQ3クラスごとのトークン埋め込みを組み込むことで、災害的忘却を伴わずに新規の視覚的コンセプトに適応する効果はどの程度か?
  • RQ4生成画像の背景画素に疑似ラベルを割り当てることで、分類の区別性能が向上し、忘却が軽減されるか?
  • RQ5ジェネレーティブリプレイのサイズ選定が、増分学習環境下でのモデル性能にどのように影響するか?

主な発見

  • ADE20K 50-50で73.45 mIoUおよび66.27 hIoUを達成し、メモリリプレイベースのベースラインを含む先行手法を上回る性能を示した。
  • アブレーションスタディの結果、DDRとSDRはそれぞれ標準的なStable Diffusion(SD)よりも性能向上を示し、特にADE20KではDDRが最大の向上をもたらした。
  • 交差エントロピーと背景ログティトへの知識蒸留を併用した場合、単一の疑似ラベルのみを用いる場合に比べ、mIoUが2.43ポイント向上した。
  • 20枚の生成サンプルのみでもDiffusePastは強固な性能を維持するが、SDベースの生成で小規模な場合、分布不一致により性能が著しく低下する。
  • メモリリプレイベースのベースライン(SSUL-MおよびOurs-M)を常に上回り、固定メモリではなく動的かつ多様なリプレイの利点を示した。
  • アブレーションにより、背景ログティトへの知識蒸留は性能を劣化させる一方で、疑似ラベル割り当てと適切な蒸留は、忘却を顕著に軽減することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。