Skip to main content
QUICK REVIEW

[論文レビュー] SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object Detection

Junsu Kim, Hoseong Cho|arXiv (Cornell University)|Feb 27, 2024
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本論文は、事前学習済みテキストから画像への拡散モデルを用いて、古いクラスの高精細な合成画像を生成する、クラスインクリメンタルオブジェクト検出(CIOD)のための新しい安定拡散ベースの深層的再現生成手法SDDGRを提案する。繰り返しの最適化、L2知識蒸留、および新タスクの画像における古いオブジェクトの仮ラベル付けを組み合わせることで、COCO 2017で最先端の性能を達成し、70+10のシナリオにおいて古いカテゴリで40.9%のAPを達成した。

ABSTRACT

In the field of class incremental learning (CIL), generative replay has become increasingly prominent as a method to mitigate the catastrophic forgetting, alongside the continuous improvements in generative models. However, its application in class incremental object detection (CIOD) has been significantly limited, primarily due to the complexities of scenes involving multiple labels. In this paper, we propose a novel approach called stable diffusion deep generative replay (SDDGR) for CIOD. Our method utilizes a diffusion-based generative model with pre-trained text-to-diffusion networks to generate realistic and diverse synthetic images. SDDGR incorporates an iterative refinement strategy to produce high-quality images encompassing old classes. Additionally, we adopt an L2 knowledge distillation technique to improve the retention of prior knowledge in synthetic images. Furthermore, our approach includes pseudo-labeling for old objects within new task images, preventing misclassification as background elements. Extensive experiments on the COCO 2017 dataset demonstrate that SDDGR significantly outperforms existing algorithms, achieving a new state-of-the-art in various CIOD scenarios. The source code will be made available to the public.

研究の動機と目的

  • クラスインクリメンタルオブジェクト検出(CIOD)における深刻な忘れの問題に対処すること、すなわち、新しいクラスを学習する際に以前に学習したクラスを忘れてしまう現象を防ぐこと。
  • オブジェクト検出に一般的に見られるマルチオブジェクト・マルチラベルのシーンにおいて、従来の生成的再現手法の限界を克服すること。
  • 元々画像生成を目的として設計された事前学習済み安定拡散モデルを、CIODにおける高品質でクラス固有の合成データ生成に適応させること。
  • 合成データ生成とL2知識蒸留、および仮ラベル付けを組み合わせることで、インクリメンタル学習における知識の保持を向上させること。
  • 拡散ベースの生成的再現が、特に複雑なマルチオブジェクトのシナリオにおいて、従来の手法を上回ることを実証すること。

提案手法

  • 事前学習済みテキストから画像への拡散モデル(Stable Diffusion)を用い、クラス固有のプロンプトとグランドトゥルース入力を用いて、以前に学習したクラスのオブジェクトを含む合成画像を生成する。
  • 訓練済みのオブジェクト検出器が検出確信度に基づいて生成画像を評価・フィルタリングする繰り返しの最適化戦略を適用し、高精細なサンプルのみを保持する。
  • 生成画像のクラスごとの制御(1クラスあたりN枚)を実装し、品質、多様性、計算コストのバランスを保ち、低品質なサンプルの過剰生成を回避する。
  • 学生モデルと教師モデル(合成データで訓練された)の間でL2知識蒸留を実施し、直接的なエンドツーエンドのファインチューニングなしに、合成画像からの知識移転を実現する。
  • 新タスクの画像で検出された古いクラスのオブジェクトに対して仮ラベル付けを導入し、トレーニング中に背景として誤分類されないよう保証する。
  • 画像品質と数量のバランスを図るため、動的フィルタリングしきい値(0.4–0.8)を用い、アブレーションにより固定しきい値では性能が低下することが示された。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み安定拡散モデルは、マルチオブジェクト検出のシナリオにおいて、高精細でクラス固有の合成画像を効果的に生成するために適応可能か?
  • RQ2生成画像の繰り返しの最適化は、CIODにおける合成データの品質と有用性にどのように影響するか?
  • RQ3クラスインクリメンタル設定で合成データで訓練する際、知識蒸留の最適な役割は何か?
  • RQ4新タスクの画像における古いオブジェクトの仮ラベル付けは、背景としての誤分類をどの程度低減できるか?
  • RQ5生成枚数(1クラスあたり)やフィルタリングしきい値といったハイパーパrameterは、全体の性能にどのように影響するか?

主な発見

  • SDDGRは、COCO 2017の70+10 CIODシナリオにおいて、古いカテゴリで40.9%のAPという、新たな最先端性能を達成した。
  • 仮ラベル付けにより、APにおける誤検出予測(FPP)が39.1%削減され、以前に学習したクラスの検出性能が顕著に向上した。
  • 合成データとL2蒸留の組み合わせにより、全カテゴリでAPが1.2%向上し、ベースラインのファインチューニングと比較してFPPが1.5%削減された。
  • 蒸留重みλ=2が最良の性能(AP=40.9%)を示し、全テスト済みλ値および以前の最先端の40.4%を上回った。
  • 動的フィルタリングしきい値範囲(0.4–0.8)を用いることで、固定しきい値と比較して性能が1%向上し、適応的フィルタリングの重要性が示された。
  • 1クラスあたり100枚に合成画像生成を制限(N=100)することで、生成時間の短縮を実現しながらも高い性能を維持し、スケーラビリティと効率性の両立が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。