[论文解读] Towards Deep Learning Methods for Quality Assessment of Computer-Generated Imagery
本文提出了一种基于深度学习的无参考(NR)视频质量评估度量方法,用于计算机生成图像(CGI),特别针对游戏视频内容。通过在带有VMAF分数标注的帧上微调预训练的Xception网络,采用迁移学习方法,仅使用约5,000帧训练样本即实现了高性能,表明当在合成质量度量上进行训练时,卷积神经网络(CNN)能够有效预测游戏视频质量。
Video gaming streaming services are growing rapidly due to new services such as passive video streaming, e.g. Twitch.tv, and cloud gaming, e.g. Nvidia Geforce Now. In contrast to traditional video content, gaming content has special characteristics such as extremely high motion for some games, special motion patterns, synthetic content and repetitive content, which makes the state-of-the-art video and image quality metrics perform weaker for this special computer generated content. In this paper, we outline our plan to build a deep learningbased quality metric for video gaming quality assessment. In addition, we present initial results by training the network based on VMAF values as a ground truth to give some insights on how to build a metric in future. The paper describes the method that is used to choose an appropriate Convolutional Neural Network architecture. Furthermore, we estimate the size of the required subjective quality dataset which achieves a sufficiently high performance. The results show that by taking around 5k images for training of the last six modules of Xception, we can obtain a relatively high performance metric to assess the quality of distorted video games.
研究动机与目标
- 开发一种针对计算机生成图像(CGI),特别是游戏内容量身定制的基于深度学习的无参考(NR)视频质量评估度量方法。
- 研究在无参考信号可用的情况下,使用预训练卷积神经网络(CNN)进行游戏视频质量评估的可行性。
- 确定在CGI质量评估中实现有效迁移学习所需的最优CNN架构、微调策略以及最小数据集规模。
- 评估是否可以使用VMAF分数作为主观质量的代理指标进行训练,在过渡到真实平均意见得分(MOS)数据之前,仍能获得高性能模型。
提出的方法
- 使用约5,000帧游戏视频数据集,以VMAF分数作为真实标签,微调预训练Xception CNN的最后六个模块。
- 利用迁移学习,将预训练的CNN架构适配到计算机生成视频内容的特定特征。
- 通过选择每第n帧(n = 53)的方式进行数据采样,以减少冗余,同时保持模型性能。
- 比较不同CNN架构(如VGG、Xception)以及不同微调层数量(1、4、6个模块)的性能表现。
- 使用RMSE和SRCC在帧级和视频级质量预测中评估模型性能。
- 研究数据增强策略,包括随机裁剪与中心裁剪,以提升泛化能力。
实验结果
研究问题
- RQ1基于机器学习的质量评估方法是否适用于计算机生成图像?
- RQ2应如何重新训练预训练的深度CNN,以在CGI质量评估中实现良好性能?
- RQ3在当前最先进的模型中,哪种预训练CNN架构在CGI质量评估中表现最佳?
- RQ4在此背景下,有效迁移学习所需的训练数据量(以帧数计)是多少?
主要发现
- 在约5,000帧上微调Xception网络的最后六个模块,得到了性能优异的度量方法,视频级SRCC为0.987,RMSE为3.11。
- Xception架构优于其他模型,在5,287帧(n=53)上微调后,实现了视频级PCC为0.987,RMSE为3.11。
- 增加微调模块数量可提升性能,但收益递减,并在小数据集上增加过拟合风险。
- 训练期间使用随机裁剪比中心裁剪表现更优,表明更高的数据多样性有助于提升泛化能力。
- 选择每第53帧(n=53)在数据集规模与模型性能之间实现了良好平衡,且未造成显著精度下降。
- 当训练集与验证集包含重叠游戏时,性能未显著提升,表明该设置对领域重叠具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。