[論文レビュー] Human Evaluation of Text-to-Image Models on a Multi-Task Benchmark
本論文は、数え上げ、空間的推論、属性の整合性など、多様な能力をカバーする32のタスクを含む、テキストから画像を生成するモデルを評価するための新しいマルチタスクベンチマークを紹介する。3,600件の人的評価により、DALL-E 2は数え上げ(65.7%対54.4%)および顔の生成(81.7%対70.2%)でStable Diffusionを上回ったが、形状生成ではStable Diffusionがわずかに優位(57.6%対56.8%)を示した。
We provide a new multi-task benchmark for evaluating text-to-image models. We perform a human evaluation comparing the most common open-source (Stable Diffusion) and commercial (DALL-E 2) models. Twenty computer science AI graduate students evaluated the two models, on three tasks, at three difficulty levels, across ten prompts each, providing 3,600 ratings. Text-to-image generation has seen rapid progress to the point that many recent models have demonstrated their ability to create realistic high-resolution images for various prompts. However, current text-to-image methods and the broader body of research in vision-language understanding still struggle with intricate text prompts that contain many objects with multiple attributes and relationships. We introduce a new text-to-image benchmark that contains a suite of thirty-two tasks over multiple applications that capture a model's ability to handle different features of a text prompt. For example, asking a model to generate a varying number of the same object to measure its ability to count or providing a text prompt with several objects that each have a different attribute to identify its ability to match objects and attributes correctly. Rather than subjectively evaluating text-to-image results on a set of prompts, our new multi-task benchmark consists of challenge tasks at three difficulty levels (easy, medium, and hard) and human ratings for each generated image.
研究の動機と目的
- テキストから画像を生成するモデルの包括的で厳密な評価プロトコルの不足を是正し、複雑なプロンプト理解を捉えること。
- 単なる画像品質を越えて、構成的推論、属性の整合性、常識的知識を含む多様なモデル能力をテストするベンチマークの開発。
- DALL-E 2 や Stable Diffusion といった最先端モデル同士を、複数のパフォーマンス次元にわたって公平に人的アノテーションによる比較を可能にする。
- 将来のモデルを評価し、その特定の強みや限界を特定できる、スケーラブルで構造化された評価フレームワークの提供。
提案手法
- 数え上げ、空間的配置、属性マッチングといった、テキストから画像を生成するモデルの特定の能力をターゲットにした32の異なるタスクを有するマルチタスクベンチマークを設計。
- 各タスクを易しめ、普通、難しめの3つの難易度レベルに分け、各レベルに10の固有のプロンプトを割り当て、タスクごとに30のプロンプトを生成。
- 画像品質と整合性について、20名のコンピュータサイエンスの大学院生による人的評価を実施し、1〜5段階(1=最悪、5=最良)のスケールを用いる。
- 同一のデフォルトパラメータで、2つの最先端モデル(DALL-E 2(商用)、Stable Diffusion(オープンソース))をすべてのプロンプトに対して評価。
- 正規化し、各タスクおよび難易度レベルごとにパーセンテージスコアとして報告することで、直接的な比較を可能にする。
- 共通の常識、バイアス、希少な同時発生事象といった、主観的判断を要するタスクについては人的評価を用いる一方で、OCR や空間的推論などの一部のタスクはニューラルツールで自動化可能である点に注意を払う。
実験結果
リサーチクエスチョン
- RQ1テキストから画像を生成するモデルは、基本的な画像生成を超えた多様な構成的および推論的タスクにおいて、どのように性能を発揮するか?
- RQ2数え上げ、空間的関係、属性の整合性を含む複雑なプロンプトを処理する際、DALL-E 2 と Stable Diffusion の相対的な強みと弱みは何か?
- RQ3タスクの難易度が上昇するにつれてモデルのパフォーマンスはどの程度低下するか。また、特定のタスクでは一方のモデルが一貫して他方を上回るケースはあるか?
- RQ4標準化されたマルチタスク人的評価フレームワークは、将来のテキストから画像を生成するモデルをベンチマークするための信頼できるゴールドスタンダードとして機能できるか?
- RQ5どのような状況で人的評価が不可欠であり、また、自動化されたメトリクスやニューラルツールに置き換え可能となる状況は何か?
主な発見
- DALL-E 2 は数え上げタスクで著しく Stable Diffusion を上回り、正規化されたスコアは65.7%を記録したのに対し、Stable Diffusion は54.4%であった。
- 顔の生成タスクでは、DALL-E 2 が81.7%を達成した一方で、Stable Diffusion は70.2%であり、リアルで整合性の取れた顔画像の生成において優位性を示した。
- 形状生成タスクでは、Stable Diffusion がわずかに優位(57.6%)を示し、DALL-E 2(56.8%)を上回った。これは、幾何的形状の生成におけるより良い一般化性能を示唆している。
- 難易度が上昇するにつれてパフォーマンスは低下するが、DALL-E 2 は難しめの形状タスクで中程度の難易度のタスクと比較してわずかに改善を示した。
- 9つのサブタスク(3タスク×3難易度レベル)のうち、DALL-E 2 は6つでStable Diffusionを上回った。これは、複雑な構成的生成において一貫した優位性を示している。
- このベンチマークは、モデルの行動の微細な差を的確に捉えることに成功し、モデル選定は一般の画像品質ではなく、特定の用途のニーズに基づくべきであることを浮き彫りにした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。