[論文レビュー] Generative Visual Prompt: Unifying Distributional Control of Pre-Trained Generative Models
本稿では、CLIP、分類器、逆画像生成モデルなどの汎用モデルを制御信号として用いることで、事前学習済み生成モデルに対する分布的制御を実現する新規フレームワーク、Generative Visual Prompt (PromptGen) を提案する。制御を可逆ニューラルネットワークを用いて近似するエネルギーベースモデルとして定式化することで、推論時に最適化を必要とせず、効率的なフォワードスキャンが可能となり、StyleGAN2 や拡散自己符号化器、NVAE といった多様なモデルにおいて、CLIP や分類器、逆画像生成モデルを用いて制御可能でバイアスのない生成が実現される。
Generative models (e.g., GANs, diffusion models) learn the underlying data distribution in an unsupervised manner. However, many applications of interest require sampling from a particular region of the output space or sampling evenly over a range of characteristics. For efficient sampling in these scenarios, we propose Generative Visual Prompt (PromptGen), a framework for distributional control over pre-trained generative models by incorporating knowledge of other off-the-shelf models. PromptGen defines control as energy-based models (EBMs) and samples images in a feed-forward manner by approximating the EBM with invertible neural networks, avoiding optimization at inference. Our experiments demonstrate how PromptGen can efficiently sample from several unconditional generative models (e.g., StyleGAN2, StyleNeRF, diffusion autoencoder, NVAE) in a controlled or/and de-biased manner using various off-the-shelf models: (1) with the CLIP model as control, PromptGen can sample images guided by text, (2) with image classifiers as control, PromptGen can de-bias generative models across a set of attributes or attribute combinations, and (3) with inverse graphics models as control, PromptGen can sample images of the same identity in different poses. (4) Finally, PromptGen reveals that the CLIP model shows a "reporting bias" when used as control, and PromptGen can further de-bias this controlled distribution in an iterative manner. The code is available at https://github.com/ChenWu98/Generative-Visual-Prompt.
研究の動機と目的
- GAN や拡散モデルなどの教師なし事前学習済み生成モデルにおける制御性の欠如とバイアスの問題に対処すること。
- モデル固有の微調整やラベル付きデータを必要とせず、多様な生成モデル間での分布的制御を統一すること。
- 推論時に最適化を回避することで、効率的でフォワードスキャン可能なサンプリングを実現すること。
- CLIP のような事前学習済み制御モデルにおけるバイアスを明らかにし、反復的制御合成によってこれを軽減すること。
- トレーニング後は制御を生成モデルから分離できるモジュール型で独立したフレームワークを提供すること。
提案手法
- PromptGen は、CLIP や分類器、逆画像生成ネットワークといった汎用モデルによって定義されるエネルギーベースモデル(EBM)として制御を定式化する。
- EBM を可逆ニューラルネットワーク(INN)を用いて近似することで、反復的最適化を必要とせず、高速なフォワードスキャンが可能になる。
- 事前学習済み生成モデルの重みを固定したままにすることで、再トレーニングの必要がない。
- 制御信号は、生成モデルの潜在空間と INN を合成することで適用され、サンプリング可能な新しい微分可能な分布が形成される。
- 合成モデルを新たな生成モデルとして扱うことで、反復的制御が可能となり、バイアスのある分布の改善が可能になる。
- 本手法は、基盤となる生成モデルに依存しないため、StyleGAN2 や StyleNeRF、拡散自己符号化器、NVAE などに対応可能である。
実験結果
リサーチクエスチョン
- RQ1汎用モデル(例:CLIP や分類器)を制御信号として用いることで、事前学習済み生成モデルからの効率的でフォワードスキャン可能なサンプリングが可能か?
- RQ2モデル固有の適応を必要とせず、GAN や拡散モデル、VAE といった多様な生成モデル間での制御を統一できるか?
- RQ3事前学習済み分類器を用いて、人種や性別といった属性におけるバイアスを PromptGen が除去できるか?
- RQ4CLIP に内在するバイアス(例:報告バイアス)が制御生成に現れ、それを軽減できるか?
- RQ5反復的制御合成により、生成分布の品質と公平性が向上するか?
主な発見
- PromptGen は、推論時に最適化を必要とせず、CLIP や分類器、ポーズ回帰器といった汎用モデルを制御信号として用いることで、事前学習済み生成モデルからの効率的でフォワードスキャン可能なサンプリングを実現する。
- CLIP を制御信号として用いることで、PromptGen は「赤ちゃんの写真」といったテキストプロンプトに高精度で一致する画像を生成するのに成功した。
- 人種分類器によって誘導された場合、PromptGen は人種グループ間で均等にサンプリングされ、StyleGAN2 の元来の白人への偏向を効果的に除去した。
- 逆画像生成モデルを用いることで、ポーズを変化させてもアイデンティティを保持する生成が可能になった。
- フレームワークは、CLIP が「メイクをしない」という表現に対して女性と正の相関を示す「報告バイアス」を示していることを明らかにしたが、PromptGen はこれを反復的に除去可能である。
- 失敗モードは PromptGen と CLIP の検索結果で一貫しており、否定の解釈や数値のカウントの誤解といった失敗は、CLIP の制限に起因しており、PromptGen の手法に起因するものではない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。