Skip to main content
QUICK REVIEW

[论文解读] Multi-Scale Features and Parallel Transformers Based Image Quality Assessment

Abhisek Keshari, Komal|arXiv (Cornell University)|Apr 20, 2022
Image and Video Quality Assessment被引用 4
一句话总结

本文提出了一种新型全参考图像质量评估模型 MSFPT,通过将多尺度卷积特征与并行变换器相结合,提升了感知质量预测性能。通过利用多尺度输入和基于变换器的架构,该方法在基准数据集上实现了最先进性能,在 NTIRE 2022 挑战赛中,SRCC 指标最高优于 DISTS 和 LPIPS 模型 0.068。

ABSTRACT

With the increase in multimedia content, the type of distortions associated with multimedia is also increasing. This problem of image quality assessment is expanded well in the PIPAL dataset, which is still an open problem to solve for researchers. Although, recently proposed transformers networks have already been used in the literature for image quality assessment. At the same time, we notice that multi-scale feature extraction has proven to be a promising approach for image quality assessment. However, the way transformer networks are used for image quality assessment until now lacks these properties of multi-scale feature extraction. We utilized this fact in our approach and proposed a new architecture by integrating these two promising quality assessment techniques of images. Our experimentation on various datasets, including the PIPAL dataset, demonstrates that the proposed integration technique outperforms existing algorithms. The source code of the proposed algorithm is available online: https://github.com/KomalPal9610/IQA

研究动机与目标

  • 为应对多媒体中图像失真日益复杂的挑战,提升无参考与全参考图像质量评估性能。
  • 弥合图像质量评估中多尺度特征提取与基于变换器建模之间的差距。
  • 开发一种稳健的端到端深度学习框架,使其在质量预测中更贴近人类感知。
  • 在包括 PIPAL 和 NTIRE 2022 在内的多样化 IQA 基准上超越现有最先进方法。
  • 验证并行变换器结合多尺度输入在感知质量估计中的有效性。

提出的方法

  • 通过在四个不同尺度(1x、2x、3x 和 0.5x 分辨率)处理输入图像,实现多尺度特征提取。
  • 使用 CNN 主干网络提取多尺度特征,并将其输入到并行变换器编码器-解码器架构中,以实现跨尺度特征融合与基于注意力的表征学习。
  • 模型采用多头自注意力机制与可学习的位置嵌入,以建模图像块之间的长距离依赖关系。
  • 通过多个尺度的块级质量评分的加权平均,生成最终的图像质量预测结果。
  • 网络使用 L1 损失进行训练,优化器为 Adam,采用权重衰减与余弦退火学习率调度,批量大小为 16。
  • 训练过程中应用随机裁剪、翻转与旋转等数据增强技术,以提升泛化能力。

实验结果

研究问题

  • RQ1将多尺度特征与并行变换器结合是否能提升全参考图像质量评估性能?
  • RQ2所提出的 MSFPT 模型在多样化数据集上与当前最先进深度学习 IQA 方法相比表现如何?
  • RQ3多尺度输入与并行注意力机制对模型鲁棒性与准确性的贡献是什么?
  • RQ4在多个尺度上共享变换器架构是否能增强特征学习与泛化能力?
  • RQ5与非深度学习及浅层学习方法相比,该模型在性能上表现如何?

主要发现

  • 在 NTIRE 2022 全参考挑战赛验证集上,MSFPT 主要得分达到 1.598,SRCC 为 0.81,PLCC 为 0.788,优于所有基线模型。
  • 在 NTIRE 2022 测试集上,MSFPT 主要得分为 1.45,SRCC 为 0.738,PLCC 为 0.713,显著优于 DISTS(1.342,0.655,0.687)与 LPIPS-VGG(1.228,0.595,0.633)。
  • 在 KADID-10k 数据集上,MSFPT 比 VSI 在 PLCC 上高出 0.01,SRCC 高出 0.004,KRCC 高出 0.009,表明其与人类主观评价具有更优的相关性。
  • 在 TID2013 数据集上,该模型的 SRCC 比现有深度学习模型高出 0.021,KRCC 高出 0.034,表明其在多种失真类型下性能更优。
  • 在 LIVE 数据集上,MSFPT 比 IQT 方法在 SRCC 上高出 0.07,KRCC 高出 0.029,证实其在全参考设置下的有效性。
  • 消融实验表明,使用标准的 'Attention is All You Need' 变换器架构优于 BERT 基础变体,验证了该架构在 IQA 任务中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。