Skip to main content
QUICK REVIEW

[論文レビュー] Fill-Up: Balancing Long-Tailed Data with Generative Models

Joonghyuk Shin, Minguk Kang|arXiv (Cornell University)|Jun 12, 2023
Handwritten Text Recognition Techniques被引用数 5
ひとこと要約

本稿では、テキストインバージョンを活用して、実データと密接に一致するクラス固有の合成画像を生成することで、画像認識における長尾データ分布の緩和を図る新規手法Fill-Upを提案する。事前学習済みのテキストから画像への拡散モデル(Stable Diffusion)において、各クラスごとにランダムに初期化されたテキストトークンを最適化することで、クラス固有の画像を生成する。このアプローチにより、代表されないクラスが適切にバランスされ、ImageNet-LT、iNaturalist2018、Places-LTの各ベンチマークで、スクラッチからの学習において最先端の性能を達成する。

ABSTRACT

Modern text-to-image synthesis models have achieved an exceptional level of photorealism, generating high-quality images from arbitrary text descriptions. In light of the impressive synthesis ability, several studies have exhibited promising results in exploiting generated data for image recognition. However, directly supplementing data-hungry situations in the real-world (e.g. few-shot or long-tailed scenarios) with existing approaches result in marginal performance gains, as they suffer to thoroughly reflect the distribution of the real data. Through extensive experiments, this paper proposes a new image synthesis pipeline for long-tailed situations using Textual Inversion. The study demonstrates that generated images from textual-inverted text tokens effectively aligns with the real domain, significantly enhancing the recognition ability of a standard ResNet50 backbone. We also show that real-world data imbalance scenarios can be successfully mitigated by filling up the imbalanced data with synthetic images. In conjunction with techniques in the area of long-tailed recognition, our method achieves state-of-the-art results on standard long-tailed benchmarks when trained from scratch.

研究の動機と目的

  • 実世界の画像認識において、希少クラスが十分な訓練データを獲得できないという長尾データ分布の課題に対処すること。
  • 既存のデータ拡張および生成手法が、合成データを現実のドメイン分布と整合させられないという限界を克服すること。
  • クラス固有のテキストプロンプトを必要とせず、高品質でクラス固有の合成画像を効率的かつ軽量に生成する手法を開発すること。
  • テキストインバージョンを用いて生成された合成データが、実データと組み合わせることで、長尾ベンチマークにおける認識性能を顕著に向上させられることを実証すること。
  • シンプルな二段階訓練手順とバランスの取れたソフトマックス損失を用いて、標準的な長尾ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、各クラスごとにランダムに初期化されたテキストトークンを最適化することで、クラス名や説明文を必要とせずにクラス固有の画像を生成できるテキストインバージョンを採用する。
  • 二段階の訓練手順を導入する:第一段階では最適化されたテキストトークンを用いて合成画像を生成し、第二段階では実画像と合成画像の組み合わせデータセット上で分類器をファインチューニングする。
  • 計算コストを低減するために、潜在空間で最適化を実行する前提となるStable Diffusion v1.5モデルを活用する。
  • 各クラスに対して、そのクラスの実画像のみを用いてテキストインバージョンを適用することで、画像データのみからクラス固有の視覚的コンセプトを学習可能にする。
  • クラスの不均衡をさらに軽減し、希少クラスにおける一般化性能を向上させるために、訓練中にバランスの取れたソフトマックス損失を用いる。
  • 合成画像はスケールハイパーパrameter(例:1.0 または 7.5)を用いて多様性と品質を制御し、1枚の画像生成にGPU 1台で約3秒の推論時間を要する。

実験結果

リサーチクエスチョン

  • RQ1クラス固有のテキストプロンプトを必要とせず、現実のデータ分布と整合する合成画像をテキストインバージョンで効果的に生成できるか?
  • RQ2最適化されたテキストトークンを用いて生成された合成データが、スクラッチからの学習において長尾ベンチマークの認識性能を向上させるか?
  • RQ3従来のデータ拡張および生成アプローチと比較して、本手法は性能およびドメイン整合性において優れているか?
  • RQ420枚未満の訓練サンプルを持つ希少クラスにおいて、本手法が顕著に精度を向上させられるか?
  • RQ5二段階訓練手順とバランスの取れたソフトマックス損失が、長尾設定におけるモデルの一般化性能に与える影響は何か?

主な発見

  • 本手法は、スクラッチからの学習において、ImageNet-LT、iNaturalist2018、Places-LTで最先端の精度を達成し、既存手法を上回る。
  • ImageNet-LTでは、260万枚の埋め込み済み画像を用いてトップ-1精度78.4%を達成し、ベースラインモデルを著しく上回る。
  • 特に少サンプル状況において顕著な向上を示し、希少クラス(例:5サンプルのptarmigan)がベースライン手法よりも顕著に高い精度を達成する。
  • すべてのベンチマークにおいて、定性的および定量的評価の両方で、テキストインバージョンベースの生成が他の画像対画像およびトランスモダル生成手法を上回る。
  • 二段階訓練手順とバランスの取れたソフトマックス損失が、長尾分布において性能向上に寄与しており、特に顕著である。
  • 本手法は計算的にも効率的である:1枚の画像生成に約3秒、1クラスの最適化に約30分(1台のRTX 3090で)を要する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。