Skip to main content
QUICK REVIEW

[论文解读] An Unsupervised Information-Theoretic Perceptual Quality Metric

Sangnie Bhardwaj, Ian Fischer|arXiv (Cornell University)|Jun 11, 2020
Image and Video Quality Assessment参考文献 36被引用 14
一句话总结

本文提出感知信息度量(PIM),一种无监督图像质量评估模型,利用信息论目标和来自人类视觉系统生理学的归纳偏置——特别是高效编码和慢度原则——仅使用视频帧对进行训练。PIM 在 BAPPS 上的表现与监督度量(如 LPIPS)相当,并在 CLIC 2020 压缩排名任务中表现更优,且无需任何人工标注的质量评分。

ABSTRACT

Tractable models of human perception have proved to be challenging to build. Hand-designed models such as MS-SSIM remain popular predictors of human image quality judgements due to their simplicity and speed. Recent modern deep learning approaches can perform better, but they rely on supervised data which can be costly to gather: large sets of class labels such as ImageNet, image quality ratings, or both. We combine recent advances in information-theoretic objective functions with a computational architecture informed by the physiology of the human visual system and unsupervised training on pairs of video frames, yielding our Perceptual Information Metric (PIM). We show that PIM is competitive with supervised metrics on the recent and challenging BAPPS image quality assessment dataset and outperforms them in predicting the ranking of image compression methods in CLIC 2020. We also perform qualitative experiments using the ImageNet-C dataset, and establish that PIM is robust with respect to architectural details.

研究动机与目标

  • 开发一种不依赖于昂贵人工标注数据(如质量评分或分类标签)的感知图像质量度量方法。
  • 探究来自人类视觉系统生理学的归纳偏置(高效编码与慢度原则)是否能提升无监督图像质量预测性能。
  • 构建一种在无需针对特定失真类型微调的情况下,对多样化图像失真具有强泛化能力的度量方法。
  • 评估在视频帧对上进行无监督训练是否能产生与最先进监督模型性能相当的感知度量。

提出的方法

  • 该模型使用多尺度、概率编码器将图像映射到潜在空间,通过深度神经网络参数化以实现近似推理。
  • 采用潜在分布之间的对称 Kullback–Leibler 散度作为感知距离度量。
  • 训练目标基于最大化时间相邻视频帧之间的预测信息(互信息),以强制实现慢度特性。
  • 网络架构强制实现空间与时间平移等变性以及多尺度空间等变性,以模拟早期视觉处理过程。
  • 模型通过仅使用自然视频数据端到端无监督训练,无需任何人工质量标注。
  • 潜在表征设计为灵活且表达能力强,允许在图像模糊区域进行不确定性建模。

实验结果

研究问题

  • RQ1能否在完全不使用人工标注质量评分或分类数据的情况下,有效训练出感知图像质量度量?
  • RQ2通过在视频帧上进行对比学习强制实现慢度原则,是否能提升感知质量预测性能?
  • RQ3潜在表征中的高效编码原则是否能比人工设计或监督度量更准确地匹配人类感知?
  • RQ4所提出的度量方法对网络深度或多尺度设计等架构变化的鲁棒性如何?
  • RQ5无监督模型在标准图像质量评估基准上,能在多大程度上达到监督模型(如 LPIPS)的性能?

主要发现

  • 在 BAPPS-2AFC 数据集上,PIM 与人类评分的吻合度达到 69.1%,接近人类评分者之间的 73.9% 吻合度。
  • 在 BAPPS-JND 数据集上,PIM 表现优于监督模型 LPIPS,该数据集用于评估可察觉差异。
  • 在 CLIC 2020 压缩排名基准上,PIM 在预测图像压缩方法排名方面优于所有监督度量。
  • 该模型对架构变化(如网络深度或多尺度设计)表现出强鲁棒性,表明核心归纳偏置具有稳定性。
  • 尽管未使用任何人工标注的质量数据,PIM 仍实现了与监督模型相当的性能,证明了信息论与生理学归纳偏置的有效性。
  • 该模型在各种失真类型下表现一致,表明其泛化能力超越了特定失真类型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。