Skip to main content
QUICK REVIEW

[論文レビュー] DiffFit: Unlocking Transferability of Large Diffusion Models via Simple Parameter-Efficient Fine-Tuning

Enze Xie, Lewei Yao|arXiv (Cornell University)|Apr 13, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

DiffFitは、特定の層のバイアス項とスケーリング係数のみを更新することで、大規模な拡散モデル向けにパラメータ効率の良い微調整手法を提案する。全微調整と比較して2倍の高速化と0.12%のパラメータ保存コストを達成し、256×256のチェックポイントから25エポックのみで微調整することで、ImageNet 512×512で3.02のSOTA FIDを達成。最も近い競合手法と比較して30倍の高い学習効率を示した。

ABSTRACT

Diffusion models have proven to be highly effective in generating high-quality images. However, adapting large pre-trained diffusion models to new domains remains an open challenge, which is critical for real-world applications. This paper proposes DiffFit, a parameter-efficient strategy to fine-tune large pre-trained diffusion models that enable fast adaptation to new domains. DiffFit is embarrassingly simple that only fine-tunes the bias term and newly-added scaling factors in specific layers, yet resulting in significant training speed-up and reduced model storage costs. Compared with full fine-tuning, DiffFit achieves 2$ imes$ training speed-up and only needs to store approximately 0.12\% of the total model parameters. Intuitive theoretical analysis has been provided to justify the efficacy of scaling factors on fast adaptation. On 8 downstream datasets, DiffFit achieves superior or competitive performances compared to the full fine-tuning while being more efficient. Remarkably, we show that DiffFit can adapt a pre-trained low-resolution generative model to a high-resolution one by adding minimal cost. Among diffusion-based methods, DiffFit sets a new state-of-the-art FID of 3.02 on ImageNet 512$ imes$512 benchmark by fine-tuning only 25 epochs from a public pre-trained ImageNet 256$ imes$256 checkpoint while being 30$ imes$ more training efficient than the closest competitor.

研究の動機と目的

  • 大規模な事前学習済み拡散モデルを新しいドメインに効率的に適応する課題に対処すること。
  • 拡散モデルの微調整における学習時間とモデル保存コストを削減すること。
  • 最小限の追加パラメータで低解像度の事前学習済みモデルを高解像度生成に迅速に適応できること。
  • 高いパラメータ効率を維持しながら、下流ベンチマークで最先端のパフォーマンスを達成すること。

提案手法

  • DiffFitは、拡散モデルの特定の層におけるバイアス項と新たに追加されたスケーリング係数のみを微調整する。
  • この手法は、残差ブロックに学習可能なスケーリング係数を導入し、主ネットワークの重みは凍結したまま、微調整中にスケーリング係数のみを更新する。
  • スケーリング係数は残差接続の前に特徴マップに適用され、適応中に動的特徴変調を可能にする。
  • このアプローチは、更新対象パラメータが全体のわずか(~0.12%)であるため、パラメータ効率が非常に高い。
  • 理論的分析により、スケーリング係数がネットワークの再トレーニングなしに特徴表現を変調可能であることが示された。
  • 最小限の学習可能なパラメータを追加することで、低解像度から高解像度へのゼロショット適応をサポートする。

実験結果

リサーチクエスチョン

  • RQ1パラメータ効率の良い微調整戦略は、学習コストと保存コストを大幅に削減しながら、下流の拡散タスクで競争力のあるパフォーマンスを達成できるか?
  • RQ2学習可能なスケーリング係数とバイアス項の使用は、事前学習済み拡散モデルの迅速な適応にどの程度効果的か?
  • RQ3最小限の追加パラメータで、低解像度の事前学習済み拡散モデルを高解像度生成に効率的に適応できるか?
  • RQ4大規模な拡散モデルの微調整において、パラメータ効率とパフォーマンスのトレードオフはどのようなものか?
  • RQ5提案手法は、FIDと学習効率の両面で、全微調整および他のパラメータ効率の良いベースラインを上回っているか?

主な発見

  • DiffFitは、ImageNet 512×512ベンチマークで3.02のSOTA FIDスコアを達成し、従来の手法を上回った。
  • 全微調整と比較して、学習時間を2倍短縮し、モデルパラメータのわずか0.12%しか更新していない。
  • 256×256の事前学習済みモデルから512×512生成への適応において、最も近い競合手法と比較して30倍の高い学習効率を示した。
  • 8つの下流データセットにおいて、全微調整と比較して優れたまたは同等のパフォーマンスを達成した。
  • 最小限のパラメータオーバーヘッドで、低解像度の拡散モデルを高解像度生成に効果的に適応できた。
  • 理論的分析により、スケーリング係数が特徴表現を効果的に変調でき、迅速かつ安定した適応を可能にすることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。