Skip to main content
QUICK REVIEW

[論文レビュー] DreamDA: Generative Data Augmentation with Diffusion Models

Yunxiang Fu, Chaoqi Chen|arXiv (Cornell University)|Mar 19, 2024
Big Data Technologies and ApplicationsDecision Sciences被引用数 3
ひとこと要約

DreamDAは、実際の訓練画像の逆拡散プロセスを摂動させることで、事前学習済み拡散モデルを活用して多様で高精細な画像を生成する、革新的な生成的データ拡張フレームワークを提案する。同時に、一貫性と信頼性のある偽ラベルを生成するための自己学習フレームワーク(AMST)を導入している。4つのタスクと5つのデータセットにおいて一貫した精度向上を達成し、自然画像データセットで訓練を再開する場合、強力なベースラインを7.4%以上上回っている。

ABSTRACT

The acquisition of large-scale, high-quality data is a resource-intensive and time-consuming endeavor. Compared to conventional Data Augmentation (DA) techniques (e.g. cropping and rotation), exploiting prevailing diffusion models for data generation has received scant attention in classification tasks. Existing generative DA methods either inadequately bridge the domain gap between real-world and synthesized images, or inherently suffer from a lack of diversity. To solve these issues, this paper proposes a new classification-oriented framework DreamDA, which enables data synthesis and label generation by way of diffusion models. DreamDA generates diverse samples that adhere to the original data distribution by considering training images in the original data as seeds and perturbing their reverse diffusion process. In addition, since the labels of the generated data may not align with the labels of their corresponding seed images, we introduce a self-training paradigm for generating pseudo labels and training classifiers using the synthesized data. Extensive experiments across four tasks and five datasets demonstrate consistent improvements over strong baselines, revealing the efficacy of DreamDA in synthesizing high-quality and diverse images with accurate labels. Our code will be available at https://github.com/yunxiangfu2001/DreamDA.

研究の動機と目的

  • 従来のデータ拡張法や既存の生成的DA手法が、ドメインギャップを埋めきれなかったり多様性に欠けたりするという限界を是正すること。
  • 事前学習済み拡散モデルを用いて、元のデータ分布に従う高精細で多様な画像合成を可能にすること。
  • 拡散プロセス中に発生する意味的シフトによって生じる生成データのラベル不一致問題を、一貫性と信頼性の制約を課した強力な自己学習フレームワークにより解決すること。
  • 訓練から再開および微調整の両設定において、多様なビジョンタスクとデータセットで一貫した性能向上を実証すること。

提案手法

  • 各デノイジングステップでU-Netのボトルネック層にガウスノイズを注入することで、逆拡散プロセスを摂動させ、多様かつ現実的な画像生成を可能にする。
  • 実際の訓練画像をシードとして用い、拡散プロセスをガイドすることで、生成されたサンプルが元のデータ分布に留まるように保証する。
  • 複数の分類器ヘッド間での一貫性と信頼性を強制する、非対称なマルチヘッド自己学習(AMST)を導入し、信頼性の高い偽ラベルを生成する。
  • 類似するデータポイントですらラベルが不確実であっても、予測の一貫性を促進するため、一貫性正則化損失を適用する。
  • 共有特徴と個別ヘッドを持つマルチヘッドアーキテクチャを採用することで、偽ラベル予測のロバスト性と一般化性能を向上させる。
  • 実データと合成データを訓練中に組み合わせ、最小限の計算オーバーヘッドでエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1U-Netボトルネック層にノイズを注入することで、実画像の逆拡散プロセスを摂動させることで、元のデータ分布に従う多様で高精細な画像を生成できるか?
  • RQ2拡散プロセス中に発生する意味的シフトによって生じる生成画像のラベル不一致問題は、訓練中に効果的に緩和可能か?
  • RQ3提案された非対称マルチヘッド自己学習(AMST)フレームワークは、標準的な偽ラベル手法に比べ、精度とロバスト性の面で優れているか?
  • RQ4画像の忠実度と多様性のバランスを最適化するため、拡散プロセスの摂動に最適な位置とノイズスケールは何か?
  • RQ5DreamDAは、訓練から再開および微調整の両設定において、多様なビジョンタスクとデータセットで一貫した改善を達成できるか?

主な発見

  • DreamDAは、自然画像データセットで訓練を再開する場合、実データのみを用いる場合に比べ、モデルの精度を41%以上向上させる。
  • 事前学習済みモデルでは、元の実データセットに比べて精度が4%向上し、優れた転送性を示している。
  • 自然画像データセットで訓練を再開する場合、最も強力な拡散ベースDAベースラインを7.4%以上上回っている。
  • FIDとMMDスコアの両面で最先端の水準を達成しており、生成画像の分布的類似性と多様性に優れていることが示された。
  • アブレーションスタディの結果、潜在空間の摂動とAMSTの両方が不可欠であることが確認され、それぞれを除去すると性能が5.6%および2.4%低下した。
  • 摂動に最適なノイズスケールは3であり、U-Netボトルネック層へのノイズ注入が他の位置の摂動よりも優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。