Skip to main content
QUICK REVIEW

[论文解读] Blind Predicting Similar Quality Map for Image Quality Assessment

Da Pan, Ping Shi|arXiv (Cornell University)|May 22, 2018
Image and Video Quality Assessment参考文献 44被引用 10
一句话总结

该论文提出BPSQM,一种盲图像质量评估模型,采用由全参考IQA方法生成的相似性图引导的全卷积神经网络(FCNN),以预测像素级质量图,随后通过深度池化网络回归得到全局质量分数。该方法通过在畸变感知特征图上进行指导学习,有效建模人类视觉系统特性,在多个数据集上实现了最先进性能。

ABSTRACT

A key problem in blind image quality assessment (BIQA) is how to effectively model the properties of human visual system in a data-driven manner. In this paper, we propose a simple and efficient BIQA model based on a novel framework which consists of a fully convolutional neural network (FCNN) and a pooling network to solve this problem. In principle, FCNN is capable of predicting a pixel-by-pixel similar quality map only from a distorted image by using the intermediate similarity maps derived from conventional full-reference image quality assessment methods. The predicted pixel-by-pixel quality maps have good consistency with the distortion correlations between the reference and distorted images. Finally, a deep pooling network regresses the quality map into a score. Experiments have demonstrated that our predictions outperform many state-of-the-art BIQA methods.

研究动机与目标

  • 解决在无参考图像条件下建模人类视觉系统(HVS)特性在盲图像质量评估(BIQA)中的挑战。
  • 开发一种数据驱动、端到端的深度学习框架,仅从畸变图像中预测具有感知意义的像素级质量图。
  • 通过利用成熟全参考方法生成的中间相似性图作为监督信号,提升无参考IQA的泛化能力和准确性。
  • 探索像素级质量图预测相较于基于图像块的方法在与人类感知对齐方面的有效性。
  • 证明使用与HVS相关的地图进行指导学习可显著提升盲IQA模型的性能。

提出的方法

  • 该框架使用全卷积神经网络(FCNN)从畸变图像中逐像素预测质量图,其训练过程受到来自全参考IQA方法(如FSIM)生成的相似性图的引导。
  • 相似性图在训练过程中充当监督信号,使FCNN能够学习反映感知退化的局部像素畸变特征。
  • 采用深度池化网络(DPN)将预测的质量图聚合为单一全局质量分数,优于标准池化策略。
  • 模型采用两阶段训练流程:首先,使用相似性图监督训练FCNN;其次,训练DPN将预测的质量图映射到主观评分。
  • 通过在Koniq10k数据集上进行预训练初始化,以提升模型在较小数据集(如CLIVE)上的泛化能力。
  • 基于验证数据学习的函数,应用非线性回归(公式5)对最终质量分数进行优化。

实验结果

研究问题

  • RQ1深度学习模型能否仅基于畸变图像在盲图像质量评估中预测像素级质量图?
  • RQ2使用全参考IQA方法生成的相似性图作为监督信号,是否能提升预测质量图的感知一致性?
  • RQ3在盲IQA中,像素级质量图预测的性能与基于图像块或全局特征的方法相比如何?
  • RQ4深度池化网络能否有效从预测的像素级质量图中回归出全局质量分数?
  • RQ5在更大、更丰富的数据集(如Koniq10k)上进行预训练,是否能提升在较小、较不丰富的数据集(如CLIVE)上的泛化能力?

主要发现

  • 在Koniq10k数据集上,BPSQM取得SRCC=0.756和PLCC=0.734,优于大多数最先进方法。
  • 在CLIVE数据集上,BPSQM-Pre取得SRCC=0.716和PLCC=0.721,经Koniq10k上预训练后性能显著提升(SRCC=0.789,PLCC=0.773)。
  • 该模型展现出强大的泛化能力,在TID2008数据集上对四种畸变类型(JP2K、JPEG、WN、BLUR)的中位SRCC达到0.910,优于BRISQUE和BIECON。
  • BPSQM预测的质量图与人类感知高度一致,表现为图中较暗区域对应于噪声或模糊的人脸区域。
  • 与基于图像块的质量图相比,使用像素级质量图能实现更好的感知对齐,视觉对比结果表明其优于BIECON和FSIM。
  • 在Koniq10k上进行预训练显著提升了在小数据集上的性能,表明模型泛化能力在很大程度上依赖于训练数据的多样性与规模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。