Skip to main content
QUICK REVIEW

[論文レビュー] Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models

Ninareh Mehrabi, Palash Goyal|arXiv (Cornell University)|Nov 17, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本論文は、言語モデルを用いて明確でない質問に対する確認質問や代替の視覚的設定を生成し、人間のフィードバックによって解消することで、テキストから画像を生成するモデルにおける曖昧さを解消するフレームワークを提案する。本手法により、明確な解釈に沿った画像生成が可能となり、人間評価で最大90%の忠実度を達成する。これは、明確化によるユーザーの意図との整合性向上に起因し、新規のベンチマークデータセットと複数の評価指標を用いて検証された。

ABSTRACT

Natural language often contains ambiguities that can lead to misinterpretation and miscommunication. While humans can handle ambiguities effectively by asking clarifying questions and/or relying on contextual cues and common-sense knowledge, resolving ambiguities can be notoriously hard for machines. In this work, we study ambiguities that arise in text-to-image generative models. We curate a benchmark dataset covering different types of ambiguities that occur in these systems. We then propose a framework to mitigate ambiguities in the prompts given to the systems by soliciting clarifications from the user. Through automatic and human evaluations, we show the effectiveness of our framework in generating more faithful images aligned with human intention in the presence of ambiguities.

研究の動機と目的

  • テキストから画像を生成する際、曖昧なプロンプトが原因で意図とずれた、あるいはバイアスを含む画像出力が生じる問題に対処すること。
  • 言語モデルを用いて確認質問や視覚的設定を生成し、人間とAIの協働により曖昧さを解消するフレームワークを開発すること。
  • 文法的、意味的、不十分な記述に関する曖昧さをカバーする、テキストから画像への曖昧さベンチマーク(TAB)と呼ばれる新規ベンチマークデータセットを構築すること。
  • 曖昧さ下での画像生成の忠実度を測るための自動評価と人間評価の手順を提案・検証すること。
  • 複数のテキストから画像へのモデルを対象に、明確化がユーザーの意図と生成画像との整合性を向上させることの有効性を示すこと。

提案手法

  • TABベンチマークからの曖昧なプロンプトを検出するために、言語モデルに基づく明確化フィルタをテキストから画像モデルの前処理に適用する。
  • フィルタは、人間のフィードバックを得るための確認質問を1つ以上生成するか、人間が選択可能な複数の候補となる視覚的設定を生成する。
  • 人間のエージェントが質問に回答するか、正しい視覚的設定を選択し、その結果を元にプロンプトを精緻化した後、画像生成が行われる。
  • 生成画像について質問し、その回答を人間が提供した正解と比較することで、忠実度を測定するVQAベースの自動評価が用いられる。
  • 本フレームワークは、DALL-E MegaおよびOpenAIのDALL-Eを対象に、自動評価(VQA)と人間評価(Amazon Mechanical Turk経由)の両方で評価された。
  • ベンチマークデータセットには、複数の解釈が可能な150の曖昧なプロンプトが含まれており、400枚の画像に対して合計1200件の人的判断が行われた。

実験結果

リサーチクエスチョン

  • RQ1文法的、意味的、不十分な記述といった異なる種類の曖昧さが、テキストから画像への生成における忠実度にどのように影響を与えるか?
  • RQ2言語モデルに基づく明確化フィルタが、人間のフィードバックを介して曖昧なプロンプトを解消することで、画像の忠実度を向上させられるか?
  • RQ3自動評価指標(例:VQAベースの忠実度)は、人間評価と比較して、人間の意図との整合性をどれほど正確に測定できるか?
  • RQ4人間選択用に複数の視覚的設定を生成する手法が、単一の確認質問を生成する手法よりも、画像の忠実度向上に有効であるか?
  • RQ5明確化によって、たとえば「医師が看護師と会話する」といった状況における性別や役割のステレオタイプ的バイアスがどの程度軽減されるか?

主な発見

  • 複数の視覚的設定を人間が選択する手法を用いた場合、人間評価で最大90%の忠実度を達成し、曖昧なプロンプトのベースラインと比べて顕著に向上した。
  • VQAモデルを用いた自動評価では、複数の視覚的設定が生成された場合に最も高い性能(85–90%)を示し、一貫した忠実度スコアが得られた。
  • VQAベースの自動評価は人間の判断と強く相関しており、忠実度評価のスケーラブルな代理指標としての有効性が裏付けられた。
  • ベンチマークの正解質問ではなく、GPT-neoが生成した質問を用いても、DALL-E Megaは80%を超える高い忠実度を維持しており、明確化パイプラインの頑健性が示された。
  • 図15の定性的な結果から、明確化されたプロンプトは曖昧なプロンプトよりも、意図された視覚的解釈と著しく整合性の高い画像を生成することがわかった。
  • 本研究では、プロンプトにおける不十分な記述(例:性別、役割)がバイアスを含む画像生成を引き起こすことが判明し、明確化フレームワークによって効果的に是正された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。