Skip to main content
QUICK REVIEW

[论文解读] A crowdsourcing approach to video quality assessment

Babak Naderi, Ross Cutler|arXiv (Cornell University)|Apr 14, 2022
Image and Video Quality Assessment被引用 5
一句话总结

本论文提出了一种开源的众包视频质量评估实现,符合 ITU-T Rec. P.910 标准,通过 Amazon Mechanical Turk 实现了准确、可扩展且成本低廉的主观测试。通过强制实施评分员、设备、环境和网络资质要求,以及设置黄金问题和陷阱问题,该方法在 ACR、ACR-HR、DCR 和 CCR 方法中均实现了实验室级别的准确度和高可重复性。

ABSTRACT

The gold standard for measuring video quality is the subjective test, and the most prevalent is the ITU-T Rec. P.910, a lab-based subjective standard in use for the past two decades. However, in practice using ITU-T Rec. P.910 is slow, expensive, and requires a lab, which all create barriers to usage. As a result, most research papers that need to measure video quality don't use ITU-T Rec. P.910 but rather metrics that are not well correlated to subjective opinion. We provide an open-source extension of ITU-T Rec. P.910 based on crowdsourcing principles which address the speed, usage cost, and barrier to usage issues. We implement Absolute Category Rating (ACR), ACR with hidden reference (ACR-HR), Degradation Category Rating (DCR), and Comparison Category Rating (CCR). It includes rater, environment, hardware, and network qualifications, as well as gold and trapping questions to ensure quality. We have validated that the implementation is both accurate and highly reproducible compared to existing ITU-T Rec. P.910 lab studies.

研究动机与目标

  • 解决基于实验室的 ITU-T Rec. P.910 主观视频质量测试所面临的高成本、速度慢和后勤障碍问题。
  • 通过 Amazon Mechanical Turk 等众包平台,实现可扩展、准确且可重复的视频质量评估。
  • 通过评分员、环境、硬件和网络资质检查,以及黄金问题和陷阱问题,确保数据质量。
  • 将众包框架与传统实验室研究进行对比,以确认其可靠性和一致性。
  • 为学术界和工业界视频编码器评估提供一个可投入生产的开源工具,包括 CVPR 2022 CLIC 挑战赛中的应用。

提出的方法

  • 实施四种标准化主观测试方法:绝对类别评分(ACR)、带隐藏参考的 ACR(ACR-HR)、损伤类别评分(DCR)和对比类别评分(CCR)。
  • 通过视力敏锐度测试和色盲测试对评分员进行资质筛选,确保参与者适合参与。
  • 实施环境和硬件资质检查,以在多样化的众包工作者设备上标准化观看条件。
  • 加入网络质量检查,以确保测试期间视频流的稳定性。
  • 集成黄金问题和陷阱问题,以检测并过滤出低投入或注意力不集中的评分员。
  • 记录视频播放频率,以监控并补偿在非受控环境中可能发生的重复观看行为。
Figure 1: Data Flow Diagram.
Figure 1: Data Flow Diagram.

实验结果

研究问题

  • RQ1众包平台能否复现基于实验室的 ITU-T Rec. P.910 主观视频质量评估的准确度和可重复性?
  • RQ2评分员、环境、硬件和网络资质检查如何影响众包视频质量评分的可靠性和有效性?
  • RQ3通过众包 ACR、DCR、CCR 和 ACR-HR 方法收集的评分与传统实验室研究中的评分之间的相关性如何?
  • RQ4PSNR、MS-SSIM 和 VMAF 等客观指标与通过所提出的众包框架收集的主观评分之间的相关性如何?
  • RQ5在非受控环境中允许重复播放视频,在多大程度上能提升众包数据的质量?

主要发现

  • 众包框架在 ACR 与 ACR-HR 之间,以及 DCR 与 CCR 之间的评分中,均实现了高度相关性(皮尔逊相关系数 r > 0.96),表明不同测试方法间具有极强的一致性。
  • 该框架表现出高度可重复性,不同测试方法之间的相关系数在片段级别和模型级别均超过 0.91。
  • PSNR、MS-SSIM 和 VMAF 等客观指标与主观评分的相关性较差(皮尔逊相关系数 r < 0.73),证实其对现代视频编码器的预测能力有限。
  • 仅有 6.3% 的视频序列被播放超过一次,表明尽管允许灵活的观看策略,非受控环境中的重复观看行为仍极少,对结果影响微小。
  • 该工具已成功部署于 CVPR 2022 CLIC 挑战赛,共收集了 27 组压缩视频片段,每段序列的有效评分数在 12.1 至 21.6 之间。
  • 资质审查与验证步骤的引入显著提升了数据质量,使得在非实验室环境下实现大规模、可靠的视频质量评估成为可能。
Figure 2: The crowdsourcing test from the participant’s perspective.
Figure 2: The crowdsourcing test from the participant’s perspective.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。