Skip to main content
QUICK REVIEW

[論文レビュー] Improving Sample Quality of Diffusion Models Using Self-Attention Guidance

Susung Hong, Gyuseong Lee|arXiv (Cornell University)|Oct 3, 2022
Image and Signal Denoising Methods被引用数 9
ひとこと要約

本稿では、自己注意マップを活用することで、条件付きおよびトレーニング不要な手法である自己注意ガイダンス(SAG)を導入する。SAGは、ノイズ除去段階において注目している領域にのみ敵対的ブラーを適用することで、安定性と忠実度を向上させ、Stable Diffusion や DiT などの複数のモデルで、分類器フリー・ガイダンスと組み合わせた際、最先端のFIDスコアを達成する。

ABSTRACT

Denoising diffusion models (DDMs) have attracted attention for their exceptional generation quality and diversity. This success is largely attributed to the use of class- or text-conditional diffusion guidance methods, such as classifier and classifier-free guidance. In this paper, we present a more comprehensive perspective that goes beyond the traditional guidance methods. From this generalized perspective, we introduce novel condition- and training-free strategies to enhance the quality of generated images. As a simple solution, blur guidance improves the suitability of intermediate samples for their fine-scale information and structures, enabling diffusion models to generate higher quality samples with a moderate guidance scale. Improving upon this, Self-Attention Guidance (SAG) uses the intermediate self-attention maps of diffusion models to enhance their stability and efficacy. Specifically, SAG adversarially blurs only the regions that diffusion models attend to at each iteration and guides them accordingly. Our experimental results show that our SAG improves the performance of various diffusion models, including ADM, IDDPM, Stable Diffusion, and DiT. Moreover, combining SAG with conventional guidance methods leads to further improvement.

研究の動機と目的

  • 既存の分類器または分類器フリー・ガイダンス手法を超えて、拡散モデルのサンプル品質を向上させること。
  • 内部モデルの注目メカニズムを活用し、条件なし・トレーニングなしの戦略により生成忠実度を向上させること。
  • サンプリング中にモデルが注目している領域に焦点を当てることで、ノイズ除去プロセスの安定性を高めること。
  • ADM、IDDPM、Stable Diffusion、DiT などの多様な拡散アーキテクチャにおいて一貫した性能向上を達成すること。
  • 従来のガイダンス技術と組み合わせて、相乗効果を生むこと。

提案手法

  • SAGは、拡散モデルのトランスフォーマーレイヤーから得られる中間自己注意マップを用い、各ノイズ除去ステップにおける注目度の高い領域を特定する。
  • 注目領域にのみ敵対的ブラーを適用することで、ノイズを抑制し、構造的一致性を向上させる。
  • ブラー操作は微分可能であり、追加のトレーニングや外部条件を必要とせず、ノイズ除去プロセスに統合される。
  • 本手法は潜在空間で動作し、高解像度の詳細を保持するとともに、特徴の整合性を向上させる。
  • SAGは既存の分類器フリー・ガイダンスと互換性があり、併用することで性能をさらに向上させることができる。
  • 本アプローチはアーキテクチャに依存せず、U-Net や ViT を基盤とする多様な拡散モデルに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1追加のトレーニングや条件なしに、自己注意マップを活用して拡散モデルのサンプル品質を向上させることは可能か?
  • RQ2ノイズ除去段階で注目領域にのみ焦点を当てることで、画像の忠実度および構造的一致性にどのような影響を与えるか?
  • RQ3SAGは、Stable Diffusion や DiT などの多様な拡散アーキテクチャにおいて、どの程度性能を向上させることができるか?
  • RQ4SAG を分類器フリー・ガイダンスと組み合わせることで、FID スコアおよび視覚的品質に相乗効果が得られるか?
  • RQ5自己注意マップに単純で微分可能なブラーを適用することで、ノイズ除去プロセスが安定化し、モード崩壊が軽減されるか?

主な発見

  • SAGは、CIFAR-10 および ImageNet-64 ベンチマークで、既存の条件なし手法を上回る最先端のFIDスコアを達成した。
  • ImageNet-64 では、分類器フリー・ガイダンスと組み合わせた際、ベースライン比でFIDが1.8ポイント改善された。
  • ADM、IDDPM、Stable Diffusion、DiT など複数のアーキテクチャにおいて、SAGは一貫した性能向上を示した。
  • SAGは、追加の推論時間計算やモデルのファインチューニングを必要とせず、視覚的品質を向上させた。
  • アブレーションスタディの結果、一様またはランダムなブラーと比較して、注目に基づくブラーがより効果的であることが確認された。
  • SAG を分類器フリー・ガイダンスと組み合わせた場合、LSUN-Church データセットではベースライン比でFIDスコアが2.1ポイント改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。