Skip to main content
QUICK REVIEW

[論文レビュー] EvalCrafter: Benchmarking and Evaluating Large Video Generation Models

Yaofang Liu, Xiaodong Cun|arXiv (Cornell University)|Oct 17, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

この論文では、視覚的品質、動きの質、時間的整合性、テキストと動画の整合性の4つの側面にわたる包括的で多様なプロンプトコーパスと、多様なメトリクスを組み合わせることで、テキストから動画への生成(T2V)モデルを評価する包括的なベンチマークフレームワーク、EvalCrafterを紹介する。本研究では、単純な平均化よりも人間の評価と高い相関を示す重み付き回帰を用いた人間の好みへの適合手法を提案し、大規模T2Vモデルの評価基準を新たに確立する。

ABSTRACT

The vision and language generative models have been overgrown in recent years. For video generation, various open-sourced models and public-available services have been developed to generate high-quality videos. However, these methods often use a few metrics, e.g., FVD or IS, to evaluate the performance. We argue that it is hard to judge the large conditional generative models from the simple metrics since these models are often trained on very large datasets with multi-aspect abilities. Thus, we propose a novel framework and pipeline for exhaustively evaluating the performance of the generated videos. Our approach involves generating a diverse and comprehensive list of 700 prompts for text-to-video generation, which is based on an analysis of real-world user data and generated with the assistance of a large language model. Then, we evaluate the state-of-the-art video generative models on our carefully designed benchmark, in terms of visual qualities, content qualities, motion qualities, and text-video alignment with 17 well-selected objective metrics. To obtain the final leaderboard of the models, we further fit a series of coefficients to align the objective metrics to the users' opinions. Based on the proposed human alignment method, our final score shows a higher correlation than simply averaging the metrics, showing the effectiveness of the proposed evaluation method.

研究の動機と目的

  • 大規模なテキストから動画への生成(T2V)モデルの包括的な評価フレームワークの欠如に応えること。現在の評価はFVDやISといった限られたメトリクスに依存している。
  • 大規模言語モデルと実際のユーザー入力を用いて、詳細なアノテーションを施した、多様で現実世界を模したプロンプトベンチマークを構築すること。
  • 視覚的品質、動きの質、時間的整合性、テキストと動画の整合性の4つの側面にわたって、客観的メトリクスを用いてT2Vモデルを評価すること。
  • 学習された重み付けスキームを用いて、客観的メトリクスを人間の好みに適合させ、評価の正確性を向上させること。
  • オープンソースモデルとクローズドソースモデルの間の性能格差や制限を特定することで、今後のモデル開発に役立つインサイトを提供すること。

提案手法

  • 実際のプロンプトを分析し、大規模言語モデル(例:ChatGPT)を用いてメタタイプを拡張することで、物体、属性、動きをカバーする包括的なプロンプトリストを構築する。
  • 視覚的品質(VQA-T、VQA-A)、動きの質(Motion AC、Flow-Score)、時間的整合性(CLIP-Temp、Warp Error)、テキストと動画の整合性(SD-Score、CLIP-Score)の4つの次元にわたり、合計18の客観的メトリクスを含む、多様な評価パイプラインを設計する。
  • 200のサンプルについて、3名のアノテーターがペアワイズの判断を収集する人間の好みの研究を実施する。
  • 客観的メトリクスを人間の好みスコアにマップする重み付き回帰モデルを訓練し、スピアマンのρとケンドールのτを最大化するように係数を最適化する。
  • 学習された係数を用いて、単純なメトリクス平均化よりも人間の知覚をよりよく反映する最終的な合成スコアを計算する。
  • 未知のデータ上で、人間の判断と単純なメトリクス、および適合スコアの相関を比較することで、本手法の有効性を検証する。
Figure 1 : We propose EvalCrafter, a comprehensive framework for benchmarking and evaluating the text-to-video models, including the well-defined prompt types in grey and the multiple evaluation aspects in black circles.
Figure 1 : We propose EvalCrafter, a comprehensive framework for benchmarking and evaluating the text-to-video models, including the well-defined prompt types in grey and the multiple evaluation aspects in black circles.

実験結果

リサーチクエスチョン

  • RQ1現実世界の使用状況を反映する多様で代表的なテキストから動画へのプロンプトのベンチマークをどのように構築できるか?
  • RQ2動き、整合性、品質などの動画生成の異なる側面において、人間の知覚と最も相関の高い客観的メトリクスは何か?
  • RQ3人間の好みに客観的メトリクスを適合させる学習された重み付けスキームは、単純な平均化を上回る評価性能を示せるか?
  • RQ4オープンソースモデルとクローズドソースモデルの間には、どのような主な制限や性能格差があるか?
  • RQ5現在の最先端モデルは複数の次元にわたってどのように性能を発揮しているのか?また、繰り返し発生する失敗モードは何か?

主な発見

  • 提案された人間の好みへの適合手法は、スピアマンのρが50.2、ケンドールのτが37.6を達成し、単純な平均化(ρ=45.9、τ=33.7)を顕著に上回る、人間の判断との相関を示した。
  • CLIP-TempとWarp Errorは、時間的整合性の観点で人間の知覚と強い相関(ρ=50.0、τ=36.0)を示し、動きの安定性を測定する有効性を裏付けた。
  • SD-ScoreとCLIP-Scoreは、テキストと動画の整合性を評価する上で非常に価値があり、高い相関(ρ=30.5、τ=21.7)を示した。
  • Gen2は全体的な性能が最良であったが、人間や動物のアイデンティティの一貫性に問題を示し、ISスコアが低く、複雑なシーンの生成に失敗した。
  • オープンソースモデル(例:ModelScope-XL、ZeroScope)とクローズドソースモデル(例:PikaLab、Gen2)の間には、特に動きの質と整合性において顕著な性能格差が存在した。
  • 動きの振幅を測るメトリクス(例:Motion AC、Flow-Score)は人間の好みと相関がなかったため、人間の評価では安定性が振幅よりも重要であることが示唆された。
(a) Prompt length distribution.
(a) Prompt length distribution.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。