[论文解读] Video compression dataset and benchmark of learning-based video-quality metrics
本论文提出了一项新的基准和数据集,包含2,486个经过现代压缩标准(AVC、HEVC、AV1、VVC、VP9)压缩的视频流,并附有众包主观质量评分。该研究评估了最先进的基于学习的视频质量度量方法,结果表明,部分无参考度量方法的性能已可与顶级全参考度量方法(如VMAF)相媲美,而VMAF仍是相关性最高的全参考选项。
Video-quality measurement is a critical task in video processing. Nowadays, many implementations of new encoding standards - such as AV1, VVC, and LCEVC - use deep-learning-based decoding algorithms with perceptual metrics that serve as optimization objectives. But investigations of the performance of modern video- and image-quality metrics commonly employ videos compressed using older standards, such as AVC. In this paper, we present a new benchmark for video-quality metrics that evaluates video compression. It is based on a new dataset consisting of about 2,500 streams encoded using different standards, including AVC, HEVC, AV1, VP9, and VVC. Subjective scores were collected using crowdsourced pairwise comparisons. The list of evaluated metrics includes recent ones based on machine learning and neural networks. The results demonstrate that new no-reference metrics exhibit a high correlation with subjective quality and approach the capability of top full-reference metrics.
研究动机与目标
- 解决当前缺乏全面、最新的视频质量度量基准的问题,以反映AV1、VVC和LCEVC等现代压缩标准所产生的压缩失真。
- 克服现有数据集的局限性,这些数据集主要由较旧的AVC压缩视频构成,且主观测试局限于小规模参与者群体的实验室环境。
- 提供大规模、多样化的数据集,包含众包的成对比较,以实现对新型基于学习的质量度量方法的无偏评估。
- 通过公开的开发集和隐藏的测试集,实现对新兴视频质量评估模型的公平且可复现的基准测试。
- 通过提供基于现代编码器真实失真数据训练的资源,支持开发更准确、更符合人类感知的度量方法。
提出的方法
- 收集了使用五种现代视频压缩标准(AVC、HEVC、AV1、VP9、VVC)编码的2,486个视频流。
- 通过近11,000名参与者的众包方式,采用成对比较法进行主观质量评估。
- 构建了一个包含公开集和隐藏测试集的基准,以确保对新度量方法的无偏评估。
- 评估了22种最先进的视频质量度量方法,包括基于深度学习的无参考和全参考模型。
- 使用SROCC和KROCC相关性度量,在五个基于内容的子集上衡量其与主观评分的相关性。
- 报告了在标准硬件配置下每种度量方法的计算效率(FPS),以评估其实际可部署性。
实验结果
研究问题
- RQ1在AV1和VVC等新标准压缩的视频上,现代基于学习的无参考视频质量度量方法与主观质量的相关性如何?
- RQ2现有全参考度量方法(如VMAF)在现代压缩失真上的主观评分相关性达到何种程度?
- RQ3在旧数据集上训练的无参考度量方法能否泛化到新型压缩失真(如LCEVC中的超分辨率)?
- RQ4在新数据集中,不同内容类型(如游戏、用户生成内容、电影级内容)下,度量方法的性能表现如何变化?
- RQ5在所提出的基准上评估时,现代基于学习的度量方法的计算效率如何?
主要发现
- VMAF度量(v061)在全数据集上取得了最高的SROCC值0.972(95%置信区间:0.971–0.974),是表现最佳的全参考度量方法。
- 无参考度量方法MDTVSFA的SROCC达到0.961(95%置信区间:0.958–0.964),表现出与顶级全参考度量方法相当的性能。
- 多个无参考度量方法(包括SPAQ MT-S和SPAQ BL)在多样化内容类型上与主观评分表现出强相关性(SROCC > 0.94)。
- AVQT度量(Apple的高级视频质量工具)的SROCC为0.944(95%置信区间:0.941–0.947),表明其性能强劲,尽管公开评估有限。
- 度量方法的计算复杂度差异显著,NIQE最快(80.00 FPS),VQM最慢(280.00 FPS),凸显了准确性与速度之间的权衡。
- 度量分数分布不均匀,SSIM平均约为0.85,而PSNR呈现类似对数正态的分布,反映出传统度量方法未能捕捉到的真实世界压缩失真。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。