Skip to main content
QUICK REVIEW

[论文解读] Blindly Assess Quality of In-the-Wild Videos via Quality-aware Pre-training and Motion Perception

Bowen Li, Weixia Zhang|arXiv (Cornell University)|Aug 19, 2021
Image and Video Quality Assessment被引用 4
一句话总结

本文提出了一种盲视频质量评估(BVQA)方法,该方法利用图像质量评估(IQA)数据库上的质量感知预训练以及动作识别模型中的运动感知能力,以学习互补的时空特征。通过将这些表征与混合列表级排序损失相结合,该方法在六个真实场景下的VQA基准测试中取得了最先进性能,展现出强大的泛化能力和效率,尤其是在通过GPU加速时表现更优。

ABSTRACT

Perceptual quality assessment of the videos acquired in the wilds is of vital importance for quality assurance of video services. The inaccessibility of reference videos with pristine quality and the complexity of authentic distortions pose great challenges for this kind of blind video quality assessment (BVQA) task. Although model-based transfer learning is an effective and efficient paradigm for the BVQA task, it remains to be a challenge to explore what and how to bridge the domain shifts for better video representation. In this work, we propose to transfer knowledge from image quality assessment (IQA) databases with authentic distortions and large-scale action recognition with rich motion patterns. We rely on both groups of data to learn the feature extractor. We train the proposed model on the target VQA databases using a mixed list-wise ranking loss function. Extensive experiments on six databases demonstrate that our method performs very competitively under both individual database and mixed database training settings. We also verify the rationality of each component of the proposed method and explore a simple manner for further improvement.

研究动机与目标

  • 解决在真实场景中缺乏原始参考视频且失真类型多样且真实的情况下的盲视频质量评估挑战。
  • 通过在IQA数据库上进行质量感知预训练,减少源域(如图像分类)与目标域(真实场景VQA)之间的域偏移。
  • 通过整合预训练3D动作识别模型中的运动感知能力,增强视频表征能力。
  • 通过一种混合列表级排序损失函数,联合优化PLCC与SRCC,提升泛化能力与性能。
  • 实现高效率与可扩展性,以支持真实场景下的部署,尤其在高分辨率视频中表现优异。

提出的方法

  • 在多个IQA数据库上对帧级特征提取器进行预训练,使用人工标注的质量分数以学习感知有意义的空间特征。
  • 利用在动作识别数据集上预训练的3D卷积神经网络(如I3D)提取具有运动感知能力的时空特征。
  • 通过拼接或注意力机制融合质量感知空间特征与运动特征,形成全面的视频表征。
  • 使用混合列表级排序损失联合训练整个BVQA模型,该损失结合了皮尔逊线性相关系数(PLCC)与斯皮尔曼等级相关系数(SRCC)目标。
  • 应用基于模型的迁移学习,弥合源域(IQA与动作识别)与目标域(真实场景VQA)之间的域偏移。
  • 在目标VQA数据库上进行端到端微调,以实现对真实失真的有效适应。

实验结果

研究问题

  • RQ1在IQA数据库上进行质量感知预训练是否能提升真实场景下盲视频质量评估的特征表征能力?
  • RQ2将动作识别模型中的运动感知能力引入BVQA模型,是否能提升模型在真实失真下的性能表现?
  • RQ3混合列表级排序损失在提升与人类意见评分的相关性方面,对多样化VQA数据库的有效性如何?
  • RQ4在单独训练与混合训练设置下,该方法在多个真实场景VQA数据库上的泛化能力达到何种程度?
  • RQ5该方法在使用GPU加速时,其计算效率如何随视频分辨率提升而扩展?

主要发现

  • 所提方法在六个基准真实场景VQA数据库上均取得了最先进性能,所有数据集上SRCC与PLCC值均保持一致高水平。
  • 模型展现出强大的泛化能力,在单独数据库与混合数据库训练设置下均表现优异。
  • 质量感知预训练与运动感知能力的结合,相比仅使用空间特征或标准ImageNet预训练的模型,带来了显著的性能提升。
  • 混合列表级排序损失函数通过联合优化线性相关性与等级相关性,进一步提升了与人类意见评分的一致性。
  • GPU加速推理在2160p分辨率下相比TLVQM最高可实现16倍速度提升,展现出与分辨率提升的良好可扩展性。
  • 该方法在CPU上也能保持高精度,但GPU加速在高分辨率下提供了显著的效率优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。