[论文解读] Perceptually Motivated Method for Image Inpainting Comparison
本文通过将算法输出与人类感知相关联,提出了一种基于感知动机的客观度量方法,用于评估图像修复质量。基于对九种最先进修复方法的主观研究,结果表明,基于深度学习的无参考度量方法——特别是采用谱归一化的Inception-V4——即使未在主观数据上进行显式训练,也能与人类判断保持高度相关性。
The field of automatic image inpainting has progressed rapidly in recent years, but no one has yet proposed a standard method of evaluating algorithms. This absence is due to the problem's challenging nature: image-inpainting algorithms strive for realism in the resulting images, but realism is a subjective concept intrinsic to human perception. Existing objective image-quality metrics provide a poor approximation of what humans consider more or less realistic. To improve the situation and to better organize both prior and future research in this field, we conducted a subjective comparison of nine state-of-the-art inpainting algorithms and propose objective quality metrics that exhibit high correlation with the results of our comparison.
研究动机与目标
- 解决图像修复算法评估中缺乏标准且与感知对齐的方法的问题。
- 识别与人类对修复图像真实感感知高度相关的客观度量。
- 在不依赖主观评分的真值数据的前提下,评估全参考和无参考度量。
- 以人类感知作为黄金标准,为比较图像修复算法提供基准。
- 证明训练用于检测修复区域的模型也可作为有效的质量估计器。
提出的方法
- 对33张测试图像进行了大规模主观评估,涉及9种最先进修复算法及专业摄影师。
- 收集人类对比评分,以建立算法性能的真值基线。
- 评估全参考度量(如VGG-16特征、SSIM)和无参考度量(如Inception-V4、ResNet)与人类判断的相关性。
- 使用均方误差损失训练深度神经网络,以分类图像为“干净”或“修复”类型,权重初始化采用ImageNet预训练模型。
- 应用谱归一化和RGB噪声特征,以提升无参考模型的泛化能力和性能。
- 在训练过程中监控模型预测与人类评分的相关性,于相关性达到峰值时停止训练,以避免过拟合。
实验结果
研究问题
- RQ1现有客观度量(如PSNR、SSIM)与人类对图像修复质量感知的相关性如何?
- RQ2一个训练用于检测修复区域的无参考深度学习模型,是否也能作为有效的修复质量估计器?
- RQ3哪种客观度量与人类对修复真实感的主观评价具有最高相关性?
- RQ4训练模型以区分干净图像与修复图像,是否能产生与人类感知高度相关且无需在主观数据上进行微调的度量?
- RQ5全参考与无参考度量在预测人类对修复质量偏好的能力上如何比较?
主要发现
- 在全参考度量中,微调后的VGG-16的block5_conv3层与人类响应的皮尔逊积矩相关系数达到最高(0.89)。
- 采用谱归一化的Inception-V4模型在无参考度量中表现最佳,其与人类判断的高度相关性未依赖于主观评分的训练。
- 传统全参考度量如SSIM与人类感知的相关性较差,常低估修复结果的真实感。
- 表现最佳的无参考模型(采用谱归一化的Inception-V4)与人类对比评分的皮尔逊相关系数为0.83,斯皮尔曼等级相关系数为0.78。
- 即使未显式优化与人类相关性,训练用于检测修复区域的深度学习模型也表现出与人类感知的强一致性。
- 在相关性分析中排除真值评分后,全参考度量的优势减弱,凸显了此类度量中自比较带来的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。