Skip to main content
QUICK REVIEW

[論文レビュー] Designing a Better Asymmetric VQGAN for StableDiffusion

Zixin Zhu, Xuelu Feng|arXiv (Cornell University)|Jun 7, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、StableDiffusion向けに非対称なVQGANを提案し、画像の穴埋めやローカル編集における編集されていない領域の歪みを低減する。タスク固有の事前知識(例:穴の空いていない画像領域)を用いた条件付きデコーダーブランチと、エンコーダーよりもはるかに深いデコーダーを導入することで、細部の保持を実現するとともに、推論コストを低く抑え、穴埋めおよび編集ベンチマークで最先端の結果を達成した。

ABSTRACT

StableDiffusion is a revolutionary text-to-image generator that is causing a stir in the world of image generation and editing. Unlike traditional methods that learn a diffusion model in pixel space, StableDiffusion learns a diffusion model in the latent space via a VQGAN, ensuring both efficiency and quality. It not only supports image generation tasks, but also enables image editing for real images, such as image inpainting and local editing. However, we have observed that the vanilla VQGAN used in StableDiffusion leads to significant information loss, causing distortion artifacts even in non-edited image regions. To this end, we propose a new asymmetric VQGAN with two simple designs. Firstly, in addition to the input from the encoder, the decoder contains a conditional branch that incorporates information from task-specific priors, such as the unmasked image region in inpainting. Secondly, the decoder is much heavier than the encoder, allowing for more detailed recovery while only slightly increasing the total inference cost. The training cost of our asymmetric VQGAN is cheap, and we only need to retrain a new asymmetric decoder while keeping the vanilla VQGAN encoder and StableDiffusion unchanged. Our asymmetric VQGAN can be widely used in StableDiffusion-based inpainting and local editing methods. Extensive experiments demonstrate that it can significantly improve the inpainting and editing performance, while maintaining the original text-to-image capability. The code is available at \url{https://github.com/buxiangzhiren/Asymmetric_VQGAN}.

研究の動機と目的

  • StableDiffusionを基盤とする画像編集における、編集されていない領域での歪みアーティファクトの根本原因を特定・解消すること。
  • 特にテキストなどの細粒度構造を持つ領域において、編集画像の忠実性と細部の保持を向上させること。
  • 従来のStableDiffusionパイプラインとの互換性を維持しつつ、編集タスクでのパフォーマンスを向上させるVQGANの変種を設計すること。
  • 新しいアーキテクチャが訓練および推論においても効率的であり、広範な展開が可能であることを保証すること。

提案手法

  • デコーダーを、VQGANエンコーダ出力に加え、タスク固有の事前知識(例:穴埋めにおける未マスク領域)を入力とする条件付きデコーダーに再設計する。
  • エンコーダーよりもはるかに深く広いデコーダーを採用することで、量子化された潜在表現からの高精細な再構成を可能にする。
  • 事前学習中に一部のマスクを完全マスクに置き換えることで、デコーダーが事前知識なしに完全な画像を再構成する能力を学習できるようにする。
  • エンコーダーとStableDiffusionモデルは変更せず、デコーダーのみを微調整することで、即座に統合可能なプラグアンドプレイな設計を実現する。
  • 条件付きブランチは編集タスク時のみ有効化され、テキストから画像生成の際には無効化されるため、生成能力が保持される。
  • 動的入力ルーティングにより、事前知識を伴う編集タスクと、事前知識なしの純粋なテキストから画像生成タスクの両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1既存のStableDiffusionベースの編集手法が、なぜ編集されていない領域で深刻な歪みを生じるのか?
  • RQ2タスク固有の事前知識を組み込んだ条件付きデコーダーブランチは、編集されていない領域での再構成アーティファクトを低減できるか?
  • RQ3エンコーダーよりもデコーダーの容量を大きくすることで、細部の回復が向上し、量子化に起因する歪みが低減できるか?
  • RQ4提案された非対称VQGANは、主要な拡散モデルを再学習せずに、編集およびテキストから画像生成の両タスクで高いパフォーマンスを維持できるか?
  • RQ5提案された非対称設計における、画像品質の向上と推論コストのトレードオフは何か?

主な発見

  • 本稿で提案する非対称VQGANは、穴埋めタスクにおいてPlaceデータセットで1.03のFIDスコアを達成し、最先端の性能を示した。
  • COCOEEデータセットでは、ペイントバイエグザンプル編集で86.35%のCLIPスコアを達成し、先行手法を大きく上回った。
  • アブレーションスタディの結果、条件付きブランチによりペイントバイエグザンプルタスクにおける保持誤差が588.86から0.76に低下した。これは、強力な細部保持能力を示している。
  • 条件付きブランチがなくても、より大きなデコーダーはベースラインよりもより複雑な細部を回復できており、高精細再構成の内在的能力を示している。
  • 純粋なテキストから画像生成タスクにおいても、元のStableDiffusionと同等またはそれ以上のパフォーマンスを維持しており、汎用性が確認された。
  • 図5、6、7の視覚的結果から、多様な編集および生成シナリオにおいて、調和性と細部保持の両面で一貫した向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。