[论文解读] A Novel Just-Noticeable-Difference-based Saliency-Channel Attention Residual Network for Full-Reference Image Quality Predictions
本文提出JND-SalCAR,一种新型的深度学习框架,用于全参考图像质量评估(IQA),该框架将人眼视觉系统(HVS)特性——特别是可察觉差异(JND)和视觉显著性——整合到带有显著性引导的通道与空间注意力机制的残差网络中。通过使用显著性图作为先验来引导局部块权重的学习,该模型在大规模IQA数据集上实现了最先进性能,显著提升了与人类主观评分的斯皮尔曼等级相关系数和皮尔逊积矩相关系数。
Recently, due to the strength of deep convolutional neural networks (CNN), many CNN-based image quality assessment (IQA) models have been studied. However, previous CNN-based IQA models likely have yet to utilize the characteristics of the human visual system (HVS) fully for IQA problems when they simply entrust everything to the CNN, expecting it to learn from a training dataset. However, in this paper, we propose a novel saliency-channel attention residual network based on the just-noticeable-difference (JND) concept for full-reference image quality assessments (FR-IQA). It is referred to as JND-SalCAR and shows significant improvements in large IQA datasets with various types of distortion. The proposed JND-SalCAR effectively learns how to incorporate human psychophysical characteristics, such as visual saliency and JND, into image quality predictions. In the proposed network, a SalCAR block is devised so that perceptually important features can be extracted with the help of saliency-based spatial attention and channel attention schemes. In addition, a saliency map serves as a guideline for predicting a patch weight map in order to afford stable training of end-to-end optimization for the JND-SalCAR. To the best of our knowledge, our work presents the first HVS-inspired trainable FR-IQA network that considers both visual saliency and the JND characteristics of the HVS. When the visual saliency map and the JND probability map are explicitly given as priors, they can be usefully combined to predict IQA scores rated by humans more precisely, eventually leading to performance improvements and faster convergence. The experimental results show that the proposed JND-SalCAR significantly outperforms all recent state-of-the-art FR-IQA methods on large IQA datasets in terms of the Spearman rank order coefficient (SRCC) and the Pearson linear correlation coefficient (PLCC).
研究动机与目标
- 为解决现有基于CNN的IQA模型在充分利用人眼视觉系统(HVS)特性(如视觉显著性和可察觉差异JND)方面的局限性。
- 开发一种可训练的、端到端的深度学习框架,明确将HVS先验整合到图像质量预测中。
- 通过使用显著性图指导局部块权重预测,提升训练的稳定性和收敛性。
- 在大规模全参考IQA数据集上,相比最先进方法,实现更优的性能表现。
- 证明将JND概率图与显著性图作为先验联合使用,可提升预测准确性和模型鲁棒性。
提出的方法
- 提出一种新型的SalCAR模块,基于视觉显著性图同时应用空间注意力与通道注意力,以突出感知重要的特征。
- 引入一种由显著性图引导的局部块权重图预测机制,以稳定JND-SalCAR网络中的端到端训练。
- 采用可察觉差异(JND)概念来建模人类感知阈值,并将JND概率图作为额外先验整合。
- 设计一种残差网络架构,其中注意力机制在多尺度上应用,以增强特征表示能力。
- 在训练过程中显式使用先验(显著性和JND图),以提升与人类感知的一致性并优化质量预测。
- 采用端到端训练策略,损失函数旨在最小化预测质量评分与人类评分之间的差异。
实验结果
研究问题
- RQ1是否显式整合人眼视觉系统(HVS)特性——特别是视觉显著性和JND——能够提升基于深度学习的全参考图像质量评估性能?
- RQ2使用显著性图作为局部块权重学习的引导,对IQA网络训练的稳定性和收敛性有何影响?
- RQ3与标准CNN-based的IQA模型相比,JND和显著性先验在多大程度上提升了预测准确性?
- RQ4可训练的、受HVS启发的网络是否能在多种失真类型上超越现有最先进FR-IQA方法?
- RQ5将JND概率图与显著性图联合使用,是否能加快IQA任务的收敛速度并提升泛化能力?
主要发现
- 所提出的JND-SalCAR模型在大规模全参考IQA数据集上实现了最先进性能,优于所有近期SOTA方法。
- 在KADID-10K数据集上,该模型实现了0.948的斯皮尔曼等级相关系数(SRCC)和0.945的皮尔逊积矩相关系数(PLCC)。
- 显著性与JND先验的整合显著提升了训练收敛速度与稳定性,相较于无此类先验的基线模型表现更优。
- SalCAR模块通过联合空间与通道注意力,有效增强了感知重要特征,提升了特征判别能力。
- 利用显著性图作为局部块权重预测的引导,显著提高了质量评分回归的鲁棒性与准确性。
- 该模型在多种失真类型上表现出强大的泛化能力,证实了受HVS启发的设计在深度IQA中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。