[論文レビュー] I Spy a Metaphor: Large Language Models and Diffusion Models Co-Create Visual Metaphors
本稿では、大規模言語モデル(LLMs)と拡散モデルが協働して視覚的比喩を生成するフレームワークを提案する。Chain-of-Thoughtプロンプティングを用いて言語的比喩の詳細な視覚的拡張を生成し、それをテキストから画像への拡散モデルの入力として利用する。主な貢献は、人間による検証を経た高品質な視覚的比喩データセット(HAIVMet)で、6,476件のサンプルを含み、視覚的含意タスクにおける精度を23ポイント向上させる。
Visual metaphors are powerful rhetorical devices used to persuade or communicate creative ideas through images. Similar to linguistic metaphors, they convey meaning implicitly through symbolism and juxtaposition of the symbols. We propose a new task of generating visual metaphors from linguistic metaphors. This is a challenging task for diffusion-based text-to-image models, such as DALL$\cdot$E 2, since it requires the ability to model implicit meaning and compositionality. We propose to solve the task through the collaboration between Large Language Models (LLMs) and Diffusion Models: Instruct GPT-3 (davinci-002) with Chain-of-Thought prompting generates text that represents a visual elaboration of the linguistic metaphor containing the implicit meaning and relevant objects, which is then used as input to the diffusion-based text-to-image models.Using a human-AI collaboration framework, where humans interact both with the LLM and the top-performing diffusion model, we create a high-quality dataset containing 6,476 visual metaphors for 1,540 linguistic metaphors and their associated visual elaborations. Evaluation by professional illustrators shows the promise of LLM-Diffusion Model collaboration for this task . To evaluate the utility of our Human-AI collaboration framework and the quality of our dataset, we perform both an intrinsic human-based evaluation and an extrinsic evaluation using visual entailment as a downstream task.
研究の動機と目的
- 言語的比喩から視覚的比喩を生成する課題に取り組むこと。これは、暗黙の意味や構文的構造をモデル化する必要がある。
- 拡散ベースのテキストから画像へのモデルの性能を向上させ、意味的で比喩的な画像を、単なる直訳的解釈を超えて生成すること。
- 今後の視覚的比喩生成および視覚言語理解分野の研究を支援するため、高品質で人間による検証済みの視覚的比喩データセットを作成すること。
- LLM-拡散モデルの協働および人間とAIの共同創造の有効性を、意味的で構造的に正確な視覚的比喩の生成に関して評価すること。
提案手法
- 言語的比喩に内在する暗黙の意味や主要な対象を捉える詳細な視覚的拡張を生成するために、Chain-of-Thoughtプロンプティングを用いたInstruct GPT-3(davinci-002)を活用する。
- LLMが生成した視覚的拡張を、DALL·E 2 や Stable Diffusion などの拡散ベースのテキストから画像モデルのプロンプトとして使用し、最終的な視覚的比喩を生成する。
- 人間のイラストレーターがLLM-拡散パイプラインの出力を評価・改善することで、品質と正確性を保証する人間とAIの協働フレームワークを実装する。
- 1,540個の言語的比喩から派生する6,476件の視覚的比喩を含むHAIVMetデータセットを構築し、関連する人間による検証済みの視覚的拡張を付与する。
- 専門的なイラストレーターによる人的な評価(内挿的評価)と、視覚的含意タスクという外部の下流タスクを用いた評価を通じて、フレームワークを評価する。
- OFA-baseというビジョン・ランゲージモデルをHAIVMetデータセットで微調整し、SNLI-VEでの微調整と性能を比較する。

実験結果
リサーチクエスチョン
- RQ1LLMにおけるChain-of-Thoughtプロンプティングは、拡散モデルが生成する視覚的比喩の品質を顕著に向上させることができるか?
- RQ2人間とAIの協働は、生成された視覚的比喩の構造的正確性と比喩的忠実度をどのように向上させるか?
- RQ3HAIVMetデータセットで微調整することで、標準的なベンチマークと比較して視覚的含意タスクの性能がどの程度向上するか?
- RQ4現在の拡散モデルは、視覚的比喩における暗黙的で比喩的な意味をどの程度正確に捉えられるか?
主な発見
- LLM-拡散モデルの協働フレームワークは、視覚的比喩生成の品質を顕著に向上させ、専門的なイラストレーターがLLMが生成した視覚的拡張を入力にした出力を、直接的な言語的比喩プロンプトからの出力よりも好む。
- LLMが生成した拡張をプロンプトとして使用した場合、DALL·E 2はStable Diffusion v2.1よりも正確で概念的に整合性のある視覚的比喩を生成する点で優れている。
- ビジョン・ランゲージモデルをHAIVMetデータセットで微調整することで、SNLI-VEでのみ微調整した場合と比較して、視覚的含意精度が約23ポイント向上する。
- HAIVMetデータセットは強力な構造的一般化能力を示し、『愛は欲情の川にいるクロコダイルである』のような複雑な比喩を、統合された視覚的要素で的確に捉えている。
- 人間とAIの協働は、テキストから画像生成における不十分な指定や属性と対象の結合の問題を解消するため、高品質な出力を維持するために不可欠である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。