[论文解读] Subjective and Objective Quality Assessment for in-the-Wild Computer Graphics Images
本文提出了 CGIQA-6k,一个大规模的野外计算机图形图像(CGI)数据库,包含6,000张经过感知验证质量评分的CGI图像,并提出了一种基于深度学习的无参考(NR)图像质量评估模型,该模型联合建模失真与美学质量。该方法在CGIQA-6k及关联数据库上的表现优于所有最先进的NR IQA模型,展现出在多种CGI失真下卓越的准确性和泛化能力。
Computer graphics images (CGIs) are artificially generated by means of computer programs and are widely perceived under various scenarios, such as games, streaming media, etc. In practice, the quality of CGIs consistently suffers from poor rendering during production, inevitable compression artifacts during the transmission of multimedia applications, and low aesthetic quality resulting from poor composition and design. However, few works have been dedicated to dealing with the challenge of computer graphics image quality assessment (CGIQA). Most image quality assessment (IQA) metrics are developed for natural scene images (NSIs) and validated on databases consisting of NSIs with synthetic distortions, which are not suitable for in-the-wild CGIs. To bridge the gap between evaluating the quality of NSIs and CGIs, we construct a large-scale in-the-wild CGIQA database consisting of 6,000 CGIs (CGIQA-6k) and carry out the subjective experiment in a well-controlled laboratory environment to obtain the accurate perceptual ratings of the CGIs. Then, we propose an effective deep learning-based no-reference (NR) IQA model by utilizing both distortion and aesthetic quality representation. Experimental results show that the proposed method outperforms all other state-of-the-art NR IQA methods on the constructed CGIQA-6k database and other CGIQA-related databases. The database is released at https://github.com/zzc-1998/CGIQA6K.
研究动机与目标
- 为解决现有针对自然场景图像(NSIs)设计的度量方法在评估野外计算机图形图像(CGIs)时表现不佳的问题,填补CGI图像质量评估的空白。
- 构建一个大规模、经过感知验证的6,000张CGI数据库,涵盖多样化的失真类型与内容类型,包括游戏和电影CGI。
- 开发一种基于深度学习的无参考(NR)IQA模型,有效捕捉CGI中的结构失真与美学质量。
- 通过在CCT-CGI、NBU-CIQAD和LIVE-YT-Gaming数据集上的跨数据库评估,验证模型的鲁棒性与泛化能力。
提出的方法
- 作者构建了CGIQA-6k,一个包含6,000张野外CGI的数据库——其中3,000张来自游戏,3,000张来自电影——数据来自现有来源,并通过受控实验室实验获取主观质量评分。
- 提出了一种基于深度学习的NR IQA模型,采用双分支网络架构,联合编码失真与美学质量表征。
- 该模型利用预训练主干网络提取输入CGI的多层次表征,随后通过独立分支分别建模失真与美学质量。
- 通过拼接和全连接层融合两个分支,预测单一质量分数,采用均方误差损失进行端到端训练。
- 模型仅在CGIQA-6k上进行训练,并在多个外部CGIQA基准上进行评估,以衡量其泛化能力。
- 采用Sheikh等人(2006a)的方法进行统计显著性检验,比较所有模型中预测分数与主观评分之间残差分布的差异。

实验结果
研究问题
- RQ1针对自然场景图像(NSIs)设计的现有全参考与无参考IQA度量方法,能否有效迁移至野外计算机图形图像(CGIs)?
- RQ2NSIs与CGIs之间在统计特征与感知特性上的关键差异是什么,导致基于NSI的IQA模型不适用于CGI质量评估?
- RQ3如何有效设计一种基于深度学习的无参考(NR)IQA模型,以联合建模CGI中的失真与美学质量?
- RQ4所提出的模型是否能很好地泛化至具有不同内容分布与失真类型的未见CGIQA数据库?
- RQ5在CGIQA-6k及相关数据集上,失真建模与美学质量建模对整体性能的相对贡献分别是什么?
主要发现
- 所提出的NR IQA模型在CGIQA-6k数据库上取得了斯皮尔曼等级相关系数(SRCC)0.8092和皮尔逊线性相关系数(PLCC)0.8293,显著优于所有SOTA NR IQA方法。
- 在CCT-CGI数据集上,模型取得了SRCC 0.8011和PLCC 0.8055,表明其对压缩失真CGI具有强大的泛化能力。
- 在NBU-CIQAD数据集上,该模型在以色彩特定失真为主的卡通图像上取得了SRCC 0.3061和PLCC 0.3003,表明因领域偏移存在性能差距。
- 统计检验结果证实,该方法在CGIQA-6k及其子集上均显著优于所有对比模型,所有成对比较的p值均小于0.05。
- 在LIVE-YT-Gaming数据集上的表现表明,该模型可泛化至与视频相关的CGI内容,取得了SRCC 0.7088和PLCC 0.7086。
- 消融研究证实,联合建模失真与美学质量可使SRCC相比仅使用失真特征的模型提升12.3%。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。