Skip to main content
QUICK REVIEW

[论文解读] Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset

Iya Chivileva, Philip Lynch|arXiv (Cornell University)|Sep 14, 2023
Video Analysis and SummarizationComputer Science被引用 3
一句话总结

本文使用由五种最先进文本到视频(T2V)模型生成的1,005个视频的新公开数据集,评估了T2V模型的输出质量。对比了自动化指标(Inception Score、Fréchet Video Distance、CLIPSim 和 T2V-CL)与人类对视频自然度和文本-视频语义一致性的评估,发现尽管这些指标与人类判断存在中等一致性,但没有单一指标能完全捕捉质量,因此人类评估在可靠评估中依然不可或缺。

ABSTRACT

Evaluating the quality of videos generated from text-to-video (T2V) models is important if they are to produce plausible outputs that convince a viewer of their authenticity. We examine some of the metrics used in this area and highlight their limitations. The paper presents a dataset of more than 1,000 generated videos from 5 very recent T2V models on which some of those commonly used quality metrics are applied. We also include extensive human quality evaluations on those videos, allowing the relative strengths and weaknesses of metrics, including human assessment, to be compared. The contribution is an assessment of commonly used quality metrics, and a comparison of their performances and the performance of human evaluations on an open dataset of T2V videos. Our conclusion is that naturalness and semantic matching with the text prompt used to generate the T2V output are important but there is no single measure to capture these subtleties in assessing T2V model output.

研究动机与目标

  • 评估自动化指标在评估文本到视频(T2V)模型输出时的可靠性。
  • 识别现有指标(如Inception Score、Fréchet Video Distance和CLIPSim)在T2V生成中的局限性。
  • 提供一个公开可访问的数据集,包含1,005个T2V视频及其对应的提示词和人工标注,用于质量评估。
  • 将人类对视频自然度和语义一致性的评估与自动化指标进行比较,以确定各自的优缺点。
  • 确定自动化指标是否能够减少在T2V模型评估中对昂贵人工评估的依赖。

提出的方法

  • 从五种近期开源T2V模型(Aphantasia、Text2Video-Zero、T2VSynthesis、Tune-a-Video和VideoFusion)中收集了1,005个视频。
  • 应用了四种自动化指标:Inception Score、Fréchet Video Distance(FVD)、CLIPSim,以及先前T2I研究中T2V-CL指标的复现版本。
  • 采用修改后的MOS(平均意见得分)框架进行人工评估,以评分视频的自然度(感知)和与输入提示的一致性(对齐)。
  • 通过z-score标准化和重新缩放调整人工评分,以确保可比性,最终人工评分计算为调整后对齐与感知评分的平均值。
  • 使用Tukey HSD检验评估不同模型在人工评估得分上的统计显著差异。
  • 通过比较不同提示长度下的调整后MOS得分,分析提示长度对视频质量的影响。
(a) Poor Quality Images from [ 2 ]
(a) Poor Quality Images from [ 2 ]

实验结果

研究问题

  • RQ1FVD、CLIPSim和Inception Score等自动化指标与人类对T2V视频质量评估的相关性如何?
  • RQ2自动化指标在多大程度上捕捉了视频的自然度和与输入提示的语义对齐?
  • RQ3根据人工评估,哪个T2V模型表现最佳?其与自动化指标排名相比如何?
  • RQ4提示长度是否显著影响生成T2V视频的感知质量?
  • RQ5自动化指标能否在T2V模型评估中可靠地替代人工评估?

主要发现

  • 人工评估显示,Text2Video-Zero在自然度和对齐性方面均产生最高质量的视频,其次是Tune-a-Video、VideoFusion和T2VSynthesis,Aphantasia表现最差。
  • Aphantasia的人工评估得分最低,其平均感知得分为3.221,对齐得分为4.016,显著低于其他模型(Tukey HSD检验p < 0.05)。
  • Text2Video-Zero获得最高的人工评估得分(0.619),而Aphantasia得分最低(0.362),表明模型性能存在显著差异。
  • T2V-CL指标的排名与其他指标一致,但Tune-a-Video在T2V-CL中的排名高于人工评估,这是由于其卡通风格导致自然度分类器校准不足。
  • 较短的提示始终产生更高质量的输出,随着提示长度减少,对齐和感知得分均有所提高。
  • 没有单一自动化指标能完全捕捉视频质量的细微差别;尽管指标与人工评估存在中等相关性,但仍存在差异,尤其在风格独特的模型(如Tune-a-Video)上更为明显。
(b) CLIPSim Error
(b) CLIPSim Error

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。