Skip to main content
QUICK REVIEW

[論文レビュー] Real-World Image Variation by Aligning Diffusion Inversion Chain

Yuechen Zhang, Jinbo Xing|arXiv (Cornell University)|May 30, 2023
Generative Adversarial Networks and Image Synthesis被引用数 7
ひとこと要約

本稿では、拡散モデルのノイズ除去連鎖をソース画像の逆投影連鎖の潜在分布と一致させることで、高品質なリアルワールド画像のバリエーションを生成するトレーニング不要の推論パイプライン、RIVALを提案する。クロスイメージ自己注意注入と段階的潜在正規化を導入することで、ドメインギャップを低減し、従来手法に比べて優れた知覚的品質と意味的一貫性を達成する。

ABSTRACT

Recent diffusion model advancements have enabled high-fidelity images to be generated using text prompts. However, a domain gap exists between generated images and real-world images, which poses a challenge in generating high-quality variations of real-world images. Our investigation uncovers that this domain gap originates from a latents' distribution gap in different diffusion processes. To address this issue, we propose a novel inference pipeline called Real-world Image Variation by ALignment (RIVAL) that utilizes diffusion models to generate image variations from a single image exemplar. Our pipeline enhances the generation quality of image variations by aligning the image generation process to the source image's inversion chain. Specifically, we demonstrate that step-wise latent distribution alignment is essential for generating high-quality variations. To attain this, we design a cross-image self-attention injection for feature interaction and a step-wise distribution normalization to align the latent features. Incorporating these alignment processes into a diffusion model allows RIVAL to generate high-quality image variations without further parameter optimization. Our experimental results demonstrate that our proposed approach outperforms existing methods concerning semantic similarity and perceptual quality. This generalized inference pipeline can be easily applied to other diffusion-based generation tasks, such as image-conditioned text-to-image generation and stylization.

研究の動機と目的

  • 拡散ベースの画像バリエーション生成における生成画像とリアルワールド画像の間のドメインギャップを解消すること。
  • 追加のトレーニングやパrameter最適化を必要とせずに、画像バリエーションの意味的・知覚的品質を向上させること。
  • テキストプロンプトを意味的ガイドとして用いて、1枚の画像例から高品質な画像生成を可能とすること。
  • 多様なテキスト対画像生成タスクに適用可能な汎用的な推論パイプラインを開発すること。

提案手法

  • 実画像の逆投影連鎖と拡散モデルのノイズ除去連鎖を一致させるトレーニング不要の推論パイプライン、RIVALを提案する。
  • ノイズ除去過程において、生成画像とソース画像の隠れ状態間の特徴量相互作用を可能にするために、クロスイメージ自己注意注入を導入する。
  • 生成連鎖の潜在分布をソース画像からの逆投影潜在分布と一致させるために、段階的潜在正規化を適用する。
  • 注意メカニズムにおけるリファレンス特徴量の早期統合を用いて、スタイルとコンテンツの一貫性を維持する。
  • 意味的忠実度を保持しつつ、テキスト条件付けのもとで多様なバリエーションを生成できるように、変更されたノイズ除去プロセスを採用する。
  • 微調整なしに事前学習済みのDDPMを活用し、さまざまな生成タスクに即座に統合可能なプラグアンドプレイな展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1拡散ベースの画像バリエーション生成における生成画像とリアルワールド画像の間のドメインギャップをどのように低減できるか?
  • RQ2拡散サンプリング中に画像品質が劣化する要因として、潜在分布の不一致が果たす役割は何か?
  • RQ3モデル微調整なしに、クロスイメージ注意と段階的正規化が潜在分布を効果的に一致させられるか?
  • RQ4提案された一致手法が、画像バリエーションにおける知覚的品質と意味的一貫性をどのように向上させるか?
  • RQ5RIVALパイプラインは、他のテキスト対画像生成タスクへどの程度一般化可能か?

主な発見

  • DDPM やテキスト条件付き拡散といったベースライン手法に比べ、RIVALは画像バリエーションの知覚的品質と意味的類似度を顕著に向上させる。
  • 追加のトレーニングや最適化を一切必要とせず、画像バリエーション生成分野で最先端のパフォーマンスを達成する。
  • 段階的潜在正規化は、生成連鎖と逆投影連鎖間の分布乖離を効果的に低減し、ドメインギャップを最小限に抑える。
  • クロスイメージ自己注意注入により特徴量相互作用が強化され、生成画像におけるスタイルおよびコンテンツの保持が強化される。
  • ソース例のトーン、スタイル、コンテンツを維持しつつ、テキストプロンプトに基づく高品質な画像生成が可能になる。
  • RIVALはDreamBoothなどのコンセプトカスタマイズ技術と互換性があり、リアルワールド画像の一貫性を保ったまま新規コンセプトの生成がシームレスに可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。