Skip to main content
QUICK REVIEW

[論文レビュー] Best Prompts for Text-to-Image Models and How to Find Them

Nikita Pavlichenko, Dmitry Ustalov|arXiv (Cornell University)|Sep 23, 2022
Aesthetic Perception and Analysis被引用数 7
ひとこと要約

本論文では、Stable Diffusion などのテキスト対画像モデル向けに、ペairワイズのクラウドソーシング比較を用いて画像品質をランク付けすることで、最適なプロンプトキーワードを発見する人間を含む遺伝的アルゴリズムを提案する。独自のキーワードセットを特定し、キーワードなしの状態や最も人気のある15個のキーワードよりも顕著に優れた性能を発揮し、トレーニングデータでは平均ランク43.60、バリデーションデータでは46.00を達成した。

ABSTRACT

Recent progress in generative models, especially in text-guided diffusion models, has enabled the production of aesthetically-pleasing imagery resembling the works of professional human artists. However, one has to carefully compose the textual description, called the prompt, and augment it with a set of clarifying keywords. Since aesthetics are challenging to evaluate computationally, human feedback is needed to determine the optimal prompt formulation and keyword combination. In this paper, we present a human-in-the-loop approach to learning the most useful combination of prompt keywords using a genetic algorithm. We also show how such an approach can improve the aesthetic appeal of images depicting the same descriptions.

研究の動機と目的

  • テキスト対画像生成におけるプロンプトキーワードに対する体系的な評価の不足に対処すること。
  • 一般的な実践をはるかに超える画像の美的品質を向上させる最適なキーワードの組み合わせを同定すること。
  • 再現可能でスケーラブルな、人間を含むループによるプロンプトテンプレートの評価と最適化手法を開発すること。
  • コミュニティ主導のプロンプト工学の向上を可能にするために、再現可能なデータとコードを公開すること。

提案手法

  • 遺伝的アルゴリズムが、高ランクの候補を選別し、クロスオーバーや突然変異を実行した後、再評価することでキーワードセットを段階的に最適化する。
  • 各画像記述に対して、1つのキーワードセットごとに4枚の画像を生成し、評価の一貫性を確保する。
  • クラウドソーシングを用いたペアワイズ比較により、被験者が使用されたキーワードセットを知らないまま、より美的に魅力的な画像を選択する。
  • Bradley-Terry確率的ランク付けを適用し、ペアワイズ比較の結果を、各記述ごとのキーワードセットのグローバルランクに集約する。
  • 記述ごとの平均ランクを計算することで、各キーワードセットの全体的な美的品質を定量化する。
  • キーワードセットとそのランクを特徴量として、ランダムフォレスト回帰器を訓練し、最も影響力のあるキーワードを同定する。

実験結果

リサーチクエスチョン

  • RQ1テキスト対画像生成において、どのプロンプトキーワードの組み合わせが最も美的に魅力的な画像を生成するか?
  • RQ2コミュニティで人気のキーワードの性能は、体系的に最適化されたキーワードセットと比べてどうか?
  • RQ3人間の好みに従う遺伝的アルゴリズムは、優れたプロンプトテンプレートを効果的に発見できるか?
  • RQ4画像品質の向上に最も寄与するキーワードは何か?また、それらは一般的に使われているキーワードとはどのように異なるか?

主な発見

  • 提案手法により、トレーニングデータでは平均ランク43.60、バリデーションデータでは46.00を達成するキーワードセットが発見され、これは『キーワードなし』のベースラインを顕著に上回った。
  • 最も優れた性能を示したキーワードセットには、cinematic、colorful background、concept art、dramatic lighting、high detail、highly detailed、hyper realistic、intricate、intricate sharp details、octane render、smooth、studio lighting、trending on artstation が含まれる。
  • ランダムフォレストモデルが同定した最も重要なキーワードは「colorful background」であり、これは最も広く使われているキーワードの一つではない。
  • 遺伝的アルゴリズムは、人気の15個のキーワードよりも性能を向上させ、トレーニングでは平均14.25、バリデーションでは12.50のスコアを記録した。
  • 本手法は一般化能力を示し、ホールドアウトされたバリデーションセットでも高い性能を発揮したが、サンプルサイズが小さいためノイズがやや高かった。
  • 本研究では、『trending on artstation』のような人気キーワードが必ずしも最も効果的ではないことが確認され、体系的な最適化がより優れた結果をもたらすことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。