Skip to main content
QUICK REVIEW

[論文レビュー] ImagenHub: Standardizing the evaluation of conditional image generation models

Max Ku, Tianle Li|arXiv (Cornell University)|Oct 2, 2023
Virtual Reality Applications and ImpactsComputer Science被引用数 3
ひとこと要約

ImagenHubは、条件付き画像生成モデルのための標準化されたベンチマークを提案し、厳選されたデータセット、統一された推論ライブラリ、および意味的整合性と知覚的品質スコアを用いた人間評価を通じて評価を統一する。その結果、全モデルの74%が全体スコア0.5未満であり、主題駆動型生成を除き、自動評価指標と人間評価の間には良好な相関が見られなかった。

ABSTRACT

Recently, a myriad of conditional image generation and editing models have been developed to serve different downstream tasks, including text-to-image generation, text-guided image editing, subject-driven image generation, control-guided image generation, etc. However, we observe huge inconsistencies in experimental conditions: datasets, inference, and evaluation metrics - render fair comparisons difficult. This paper proposes ImagenHub, which is a one-stop library to standardize the inference and evaluation of all the conditional image generation models. Firstly, we define seven prominent tasks and curate high-quality evaluation datasets for them. Secondly, we built a unified inference pipeline to ensure fair comparison. Thirdly, we design two human evaluation scores, i.e. Semantic Consistency and Perceptual Quality, along with comprehensive guidelines to evaluate generated images. We train expert raters to evaluate the model outputs based on the proposed metrics. Our human evaluation achieves a high inter-worker agreement of Krippendorff's alpha on 76% models with a value higher than 0.4. We comprehensively evaluated a total of around 30 models and observed three key takeaways: (1) the existing models' performance is generally unsatisfying except for Text-guided Image Generation and Subject-driven Image Generation, with 74% models achieving an overall score lower than 0.5. (2) we examined the claims from published papers and found 83% of them hold with a few exceptions. (3) None of the existing automatic metrics has a Spearman's correlation higher than 0.2 except subject-driven image generation. Moving forward, we will continue our efforts to evaluate newly published models and update our leaderboard to keep track of the progress in conditional image generation.

研究の動機と目的

  • 不一致なデータセット、推論プロトコル、人間評価手法による、条件付き画像生成分野における公平で一貫性のある評価の欠如に対処する。
  • モデル間の公平な比較を可能にする、集中型かつ再現可能なベンチマークを確立する。
  • 高い評価者間一致度を達成するスケーラブルな人間評価フレームワークを構築し、信頼性の高いモデル評価を確保する。
  • 分野の進歩を追跡するための継続的に更新されるランクイングを構築する。
  • 標準化された再評価を通じて、発表済みの研究における誤解を招く主張を同定および是正する。

提案手法

  • モデル間での入力条件の統一を図るため、7つの高品質でタスク特化型の評価データセット(各100~200インスタンス)を厳選した。
  • ハイパーパramーターやプロンプト形式を固定することで、公平かつ再現可能なモデル推論を保証する統一された推論ライブラリを構築した。
  • 明確でチェックリストベースのガイドラインを用いて、意味的整合性と知覚的品質という2つの3値評価指標を設計した。
  • 専門の評価者を訓練し、提案された指標に従ってモデル出力をスコア付けした。その結果、76%のモデルで評価者間一致度が高く(Krippendorff’s alpha > 0.4)、良好な一貫性を達成した。
  • 意味的整合性と知覚的品質の幾何平均を用いて全体のモデルスコアを計算することで、性能の不均衡を懸念するのを防いだ。
  • 指標の粒度を最適化するためのアブレーションスタディを実施し、信頼性と実用性のバランスを考慮して、両指標に[0, 0.5, 1]のスケールを採用した。

実験結果

リサーチクエスチョン

  • RQ1標準化された評価条件下で、既存の条件付き画像生成モデルはどの程度一貫した性能を示すか?
  • RQ2明確なガイドラインと評価者間一致度を確保した場合、人間評価はどの程度信頼できるか?
  • RQ3さまざまな条件付き画像生成タスクにおいて、どの自動評価指標が人間評価スコアと最も相関が高いか?
  • RQ4発表済みのモデル性能に関する主張は、ImagenHubの標準化プロトコルに基づく再評価でどの程度妥当性を保っているか?
  • RQ5統一的かつ継続的に更新されるベンチマークは、条件付き画像生成分野における再現性向上と進捗追跡に寄与できるか?

主な発見

  • 評価対象の30モデルのうち74%が、人間評価の全体スコアで0.5未満であり、大多数のタスクで一般的に満足のいかない性能であることが示された。
  • 全モデルの17%(30体中5体)のみが全体スコア0.7以上を達成しており、改善の余地が著しく大きいことが浮き彫りになった。
  • 発表済みの主張の83%が、ImagenHubの標準化プロトコルに基づく再評価で正当化された。
  • ほとんどのタスクにおいて、自動評価指標と人間評価の間のスピアマン順位相関係数が0.2を上回ることはなく、主題駆動型画像生成を除いて同様の傾向が見られた。
  • 意味的整合性と知覚的品質の幾何平均は、単一の入力画像を単純にコピーするモデルが性能に偏る可能性がある加重和設定よりも、より信頼性が高かった。
  • 人間評価の[0, 0.5, 1]スケールは、評価者間一致度と実用性の両面で最良のバランスを達成しており、[0,1]や[0,0.5,1,2]のスケールを上回る信頼性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。