Skip to main content
QUICK REVIEW

[论文解读] Multi-task deep CNN model for no-reference image quality assessment on smartphone camera photos

Chen-Hsiu Huang, Ja‐Ling Wu|arXiv (Cornell University)|Aug 27, 2020
Image and Video Quality Assessment参考文献 19被引用 6
一句话总结

本文提出一种多任务深度卷积神经网络模型(DCNNS),联合预测无参考图像质量并检测智能手机相机照片中的场景类型,通过共享卷积特征提升质量评估性能。该方法在SCPQD2020数据集上实现了最先进的SROCC性能,表明场景感知特征学习可显著提升真实智能手机图像质量预测的准确性。

ABSTRACT

Smartphone is the most successful consumer electronic product in today's mobile social network era. The smartphone camera quality and its image post-processing capability is the dominant factor that impacts consumer's buying decision. However, the quality evaluation of photos taken from smartphones remains a labor-intensive work and relies on professional photographers and experts. As an extension of the prior CNN-based NR-IQA approach, we propose a multi-task deep CNN model with scene type detection as an auxiliary task. With the shared model parameters in the convolution layer, the learned feature maps could become more scene-relevant and enhance the performance. The evaluation result shows improved SROCC performance compared to traditional NR-IQA methods and single task CNN-based models.

研究动机与目标

  • 解决缺乏针对真实智能手机相机照片优化的有效无参考图像质量评估(NR-IQA)方法的问题,这些图像通常无几何失真,但因图像信号处理(ISP)处理而感知质量各异。
  • 克服传统NR-IQA方法的局限性,后者专为合成失真设计,在真实世界智能手机图像上表现欠佳。
  • 通过引入场景类型检测作为辅助任务,引导共享卷积神经网络架构中的特征学习,以提升质量预测准确性。
  • 证明多任务学习结合场景上下文可增强真实智能手机摄影中图像质量评估的特征表示能力。

提出的方法

  • 提出一种多任务深度卷积神经网络模型(DCNNS),通过共享卷积层联合执行无参考图像质量预测与场景类型分类。
  • 采用简单的图像聚类方法自动标注场景类型,用于训练辅助场景检测任务。
  • 端到端训练网络,损失函数结合质量预测损失与场景分类损失。
  • 从共享卷积层中提取同时优化质量预测与场景理解的特征。
  • 将模型应用于64×64大小的图像块,以实现局部化场景与质量分析。
  • 利用共享表征提升所学特征的泛化能力与场景相关性,尤其在复杂或低对比度区域表现更优。

实验结果

研究问题

  • RQ1将场景类型检测作为辅助任务,能否提升无参考图像质量评估在智能手机相机照片上的性能?
  • RQ2与单任务模型相比,使用共享卷积特征的多任务学习如何影响质量预测的泛化能力与准确性?
  • RQ3场景检测准确率在多大程度上与真实智能手机图像上的质量预测性能(SROCC)相关?
  • RQ4为何某些图像(尤其是夜景)表现出较低的场景检测准确率与退化的质量预测性能?
  • RQ5多任务卷积神经网络架构能否在无需合成失真的情况下,有效从原始智能手机图像中学习场景相关特征?

主要发现

  • 所提出的DCNNS模型在SCPQD2020数据集上,纹理、色彩、噪声和曝光的SROCC分别达到0.4899、0.4979、0.4723和0.4349,优于传统NR-IQA方法与单任务CNN基线模型。
  • 场景检测准确率高的图像(如图像85,准确率0.7785)表现出显著更高的SROCC得分(纹理SROCC为0.5869),而准确率低的图像(如图像55,准确率0.0289,SROCC为0.4286)则表现较差。
  • 对于光照均衡且纹理复杂的图像(场景1),模型在场景分类与SROCC方面均表现优异,两者准确率均较高。
  • 夜景(场景0)是场景分类中最具挑战性的类别,平均准确率低于0.04,这与较低的SROCC得分相关,揭示了主要局限性。
  • 辅助场景任务提升了特征学习效果,表现为场景分类准确的图像中SROCC更高,证实了多任务学习的优势。
  • 尽管性能有所提升,模型在局部场景不一致性方面仍存在困难——同一图像的不同图像块可能被错误分类为不同场景类别,从而对优化过程造成负面影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。