Skip to main content
QUICK REVIEW

[论文解读] A strong baseline for image and video quality assessment

Shaoguo Wen, Junle Wang|arXiv (Cornell University)|Nov 13, 2021
Image and Video Quality Assessment参考文献 31被引用 8
一句话总结

本文提出了一种简单而强大的统一深度学习模型,用于图像和视频质量评估,采用单一的ResNet-18主干网络提取全局特征,并结合训练优化。该模型在公开和私有数据集上均取得了最先进性能,优于VGG-19和ResNet-50等标准基线模型,并发布了三个预训练模型,适用于用户生成内容(UGC)、专业制作内容(PGC)和游戏视频等实际应用场景中的压缩视频质量评估。

ABSTRACT

In this work, we present a simple yet effective unified model for perceptual quality assessment of image and video. In contrast to existing models which usually consist of complex network architecture, or rely on the concatenation of multiple branches of features, our model achieves a comparable performance by applying only one global feature derived from a backbone network (i.e. resnet18 in the presented work). Combined with some training tricks, the proposed model surpasses the current baselines of SOTA models on public and private datasets. Based on the architecture proposed, we release the models well trained for three common real-world scenarios: UGC videos in the wild, PGC videos with compression, Game videos with compression. These three pre-trained models can be directly applied for quality assessment, or be further fine-tuned for more customized usages. All the code, SDK, and the pre-trained weights of the proposed models are publicly available at https://github.com/Tencent/CenseoQoE.

研究动机与目标

  • 建立一个强大、简单且有效的图像和视频质量评估基线模型,无需复杂架构即可超越现有方法。
  • 解决先前模型依赖多分支特征融合或过于复杂的网络结构的问题,这些结构不适合工业部署。
  • 为用户生成内容、压缩的专业内容以及游戏流媒体等多样化商业场景中的实际质量评估提供实用解决方案。
  • 发布预训练模型和代码,供工业界和研究界直接使用或微调。
  • 通过提供一个稳健的基线模型,避免仅因训练技巧带来的性能提升,实现更公平的基准测试。

提出的方法

  • 该模型使用单一的ResNet-18主干网络从输入图像或视频帧中提取全局特征表示,避免使用多分支或复杂架构。
  • 训练过程中应用随机水平翻转和随机裁剪等数据增强技术,以提升泛化能力。
  • 采用余弦退火学习率调度策略,结合权重衰减和动量,以稳定训练过程并防止过拟合。
  • 使用平均意见评分(MOS)回归进行训练,损失函数旨在最小化预测质量评分与人工标注质量评分之间的差异。
  • 训练过程包含超参数调优,初始为1e-4,最小学习率为1e-7,L2权重衰减为5e-4。
  • 最终模型在三个不同现实场景的数据集上进行微调:野生环境下的UGC视频、压缩处理的PGC视频,以及压缩处理的游戏视频。

实验结果

研究问题

  • RQ1一个简单、单分支的深度学习模型是否能在不使用复杂架构或多分支特征融合的情况下,实现强大的图像和视频质量评估性能?
  • RQ2在公开和私有数据集上,该模型与VGG-19和ResNet-50等成熟基线模型相比,在与人类感知的相关性方面表现如何?
  • RQ3在多样化的现实视频场景下进行训练的统一模型,能在多大程度上泛化到不同类型的失真(如压缩和自然失真)?
  • RQ4使用标准训练技术(如数据增强、学习率调度)是否能显著提升性能,相比朴素基线训练?
  • RQ5该模型能否作为未来研究和工业部署中质量评估的可靠、高性能基线?

主要发现

  • 在LIVE-VQC数据集上,该模型的PLCC为0.7575,SRCC为0.7390,分别优于VGG-19的PLCC(+0.04)和SRCC(+0.08)。
  • 在KoNViD-1K数据集上,模型的PLCC为0.8245,SRCC为0.8185,在对比方法中排名第二。
  • 在YouTube-UGC数据集上,模型的PLCC为0.7691,SRCC为0.7554,展现出在用户生成内容上的强大泛化能力。
  • 在私有数据集上,该模型在压缩处理的游戏视频上达到PLCC 0.971和SRCC 0.968,表明在高覆盖率压缩场景下表现极为出色。
  • 在压缩处理的PGC视频上,模型达到PLCC 0.961和SRCC 0.959;在野生环境下的UGC视频上,PLCC为0.902,SRCC为0.880,证实其在真实世界条件下的鲁棒性。
  • 发布的UGC、PGC和游戏视频场景的预训练模型可直接用于下游应用,或进行微调,代码和权重已公开提供。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。