[论文解读] Perceptual Image Quality Assessment with Transformers
该论文提出了一种图像质量变换器(IQT),通过使用基于CNN主干网络提取的参考图像与失真图像的感知特征,并利用Transformer编码器-解码器架构进行全参考感知图像质量评估。该模型在NTIRE 2021感知IQA挑战赛中取得最先进性能,主分值为1.5885(PLCC: 0.7896,SRCC: 0.7990)。
In this paper, we propose an image quality transformer (IQT) that successfully applies a transformer architecture to a perceptual full-reference image quality assessment (IQA) task. Perceptual representation becomes more important in image quality assessment. In this context, we extract the perceptual feature representations from each of input images using a convolutional neural network (CNN) backbone. The extracted feature maps are fed into the transformer encoder and decoder in order to compare a reference and distorted images. Following an approach of the transformer-based vision models, we use extra learnable quality embedding and position embedding. The output of the transformer is passed to a prediction head in order to predict a final quality score. The experimental results show that our proposed model has an outstanding performance for the standard IQA datasets. For a large-scale IQA dataset containing output images of generative model, our model also shows the promising results. The proposed IQT was ranked first among 13 participants in the NTIRE 2021 perceptual image quality assessment challenge. Our work will be an opportunity to further expand the approach for the perceptual IQA task.
研究动机与目标
- 开发一种基于深度学习的全参考图像质量评估方法,能够准确预测人类感知的图像质量,尤其针对由现代GAN-based复原算法引起的图像失真。
- 探究在自然语言处理和视觉任务中表现优异的Transformer架构,是否可有效应用于感知图像质量评估任务。
- 改进现有客观指标(如PSNR和SSIM),这些指标在具有真实感伪影的图像中无法有效捕捉感知质量。
- 评估在质量预测中使用特征级差异表示与像素级差异表示的性能差异。
- 在包括生成模型产生的失真在内的多种失真类型上,实现鲁棒且可泛化的性能表现。
提出的方法
- 使用CNN主干网络(如ResNet)从参考图像和失真图像中提取深层感知特征图。
- 将提取的特征图展平为序列标记,并通过带有可学习质量嵌入和位置嵌入的Transformer编码器-解码器架构进行处理。
- 模型使用多头自注意力机制,以建模特征空间中图像块之间的长距离依赖关系。
- 将可学习的质量嵌入与特征标记拼接,以引导Transformer预测图像质量得分。
- 添加位置嵌入以在序列表示中保留空间信息。
- 将Transformer解码器的最终输出通过预测头,回归得到最终的图像质量得分(如MOS)。
实验结果
研究问题
- RQ1基于Transformer的架构是否能有效建模参考图像与失真图像之间的感知质量差异?
- RQ2与直接处理像素级数据相比,使用CNN主干网络提取的感知特征是否能提升质量评估性能?
- RQ3在Transformer框架中,使用可学习的质量嵌入和位置嵌入是否对质量得分预测具有积极作用?
- RQ4与传统指标相比,该模型在包含现代GAN-based图像复原模型生成伪影的数据集上的表现如何?
- RQ5该模型是否能在多种失真类型上实现良好泛化,还是容易在特定数据集(如PIPAL)上过拟合?
主要发现
- IQT模型在NTIRE 2021感知IQA挑战赛中取得最高主分值1.5885,13名参赛者中排名第一。
- 在PIPAL验证集上,IQT-C变体实现了PLCC 0.7896与SRCC 0.7990,与人类主观评分具有强相关性。
- 在标准IQA数据集(LIVE、CSIQ、TID2013)上,该模型优于现有方法,LIVE数据集上SRCC/KRCC为0.970/0.845,CSIQ数据集上为0.947/0.805。
- 在感知特征空间中使用差异表示的性能优于使用像素级差异表示,证实了高层语义信息的重要性。
- 在PIPAL数据集上训练的IQT-C模型在自身测试集上表现优异,但在标准数据集上泛化能力下降,表明存在过拟合风险。
- 该模型在包含GAN生成失真的大规模数据集上表现出卓越的鲁棒性与泛化能力,凸显其在现代图像复原评估中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。