Skip to main content
QUICK REVIEW

[論文レビュー] Expanding Small-Scale Datasets with Guided Imagination

Yifan Zhang, Daquan Zhou|arXiv (Cornell University)|Nov 25, 2022
Generative Adversarial Networks and Image Synthesis被引用数 11
ひとこと要約

本論文は、Stable Diffusion や DALL-E2 などの事前学習済み生成モデルを用いて、クラスに整合的で多様性に富み、写真のようにリアルな画像を生成することで、小規模データセットを拡張するガイド付き想起フレームワーク(GIF)を提案する。クラス維持情報の強化とサンプル多様性の促進により最適化された潜在特徴を用いることで、GIF は6つの自然画像データセットにおいて平均で36.9%、3つの医療画像データセットにおいて平均で13.5%のモデル精度向上を達成し、ガイドなし生成と比較して顕著な性能向上を示す。

ABSTRACT

The power of DNNs relies heavily on the quantity and quality of training data. However, collecting and annotating data on a large scale is often expensive and time-consuming. To address this issue, we explore a new task, termed dataset expansion, aimed at expanding a ready-to-use small dataset by automatically creating new labeled samples. To this end, we present a Guided Imagination Framework (GIF) that leverages cutting-edge generative models like DALL-E2 and Stable Diffusion (SD) to "imagine" and create informative new data from the input seed data. Specifically, GIF conducts data imagination by optimizing the latent features of the seed data in the semantically meaningful space of the prior model, resulting in the creation of photo-realistic images with new content. To guide the imagination towards creating informative samples for model training, we introduce two key criteria, i.e., class-maintained information boosting and sample diversity promotion. These criteria are verified to be essential for effective dataset expansion: GIF-SD obtains 13.5% higher model accuracy on natural image datasets than unguided expansion with SD. With these essential criteria, GIF successfully expands small datasets in various scenarios, boosting model accuracy by 36.9% on average over six natural image datasets and by 13.5% on average over three medical datasets. The source code is available at https://github.com/Vanint/DatasetExpansion.

研究の動機と目的

  • 大規模なラベル付けが高コストかつ時間のかかる小規模データセットにおけるデータ不足の課題に対処すること。
  • 従来のデータ拡張技術の限界を克服し、新しいコンテンツを導入しない表面的な変換しか行わない点。
  • 情報量が多く、現実的で多様性に富んだ合成サンプルを生成する強力な事前学習済み生成モデルを活用し、モデルの一般化性能を向上させること。
  • 生成されたサンプルが元のクラスと意味的に整合的であり、同時にコンテンツのバリエーションが豊富であることを保証し、トレーニング効果を最大化すること。
  • 多様な分野に応用可能なスケーラブルで安全かつ制御可能なフレームワークを構築し、医療画像を含む幅広い分野に適用可能であること。

提案手法

  • 初期画像を潜在空間にエンコードするため、事前学習済み生成モデル(例:Stable Diffusion、DALL-E2、MAE)を事前モデルとして使用する。
  • 初期画像の潜在特徴を意味的に意味のある空間で最適化し、新しいコンテンツを含む写真のようにリアルな画像を生成する。
  • 2つの主要な基準を適用する:意味的クラスアイデンティティを維持するための情報強化と、コンテンツの多様性を保証するためのサンプル多様性促進。
  • 潜在特徴をターゲットデータセットのラベル空間にマップするために CLIP を用い、合成サンプルの正しくラベル付けされた分類を保証する。
  • Google Cloud Vision API を用いた安全確認を実施し、合成画像が成人向け、暴力的、不適切なコンテンツを含まないことを保証する。
  • 拡張されたデータセット上で深層ニューラルネットワークを学習し、標準ベンチマークでの性能評価により有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルを効果的にガイドすることで、元のクラスと意味的に整合的で、コンテンツの多様性に富んだ合成データを生成できるか?
  • RQ2クラス維持情報の強化とサンプル多様性促進の両方が、下流のトレーニングに向けた生成データの質と有用性をどのように向上させるか?
  • RQ3ガイド付き想起が、ガイドなし生成や従来のデータ拡張と比較して、小規模データセットにおけるモデル精度向上にどの程度優れているか?
  • RQ4提案されたフレームワークは、自然画像から医療画像に至る多様な分野に一般化可能であり、一貫した性能向上を達成できるか?
  • RQ5生成された合成データの安全性はどの程度で、実世界の応用に信頼性を持って利用できるか?

主な発見

  • GIF-SD は、ガイドなしの Stable Diffusion 生成と比較して、自然画像データセットで平均13.5%の精度向上を達成し、ガイド付き想起の有効性を示している。
  • 6つの自然画像データセットにおいて、GIF は平均で36.9%の精度向上を達成し、ベースラインのデータ拡張やガイドなし生成を顕著に上回っている。
  • 3つの医療画像データセットにおいて、フレームワークは平均で13.5%の精度向上を達成し、特殊分野への強い一般化能力を示している。
  • Google Cloud Vision API を用いた安全確認により、生成画像の96%が「非常にまれ」と判定され、成人向けコンテンツを含まないことが確認され、80%以上がスプーフィングまたは露出度の高いコンテンツについても「非常にまれ」と判定された。これは、高い安全性と実用への適合性を示している。
  • 可視化結果により、GIF は意味的に整合的でありながらコンテンツが多様な画像を生成することが確認された(例:猫の新しいポーズ、クッションの異なるテクスチャ)— これは情報拡張の有効性を示している。
  • CLIP を用いたゼロショットラベルマッピングにより、合成サンプルが正しく分類され、ターゲットデータセットの意味論と整合していることが保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。