[论文解读] No-Reference Image Quality Assessment via Feature Fusion and Multi-Task Learning
本文提出 QualNet,一种用于无参考图像质量评估的多任务学习框架,通过融合深度主干网络(如 VGG16)的特征,联合预测图像质量得分和失真类型。通过利用失真类型监督和专用的特征融合机制,该模型在七个不同数据集上实现了最先进性能,在使用 VGG19 的 LIVE-MD1 数据集上,SROCC 达到 0.925,LCC 达到 0.945。
Blind or no-reference image quality assessment (NR-IQA) is a fundamental, unsolved, and yet challenging problem due to the unavailability of a reference image. It is vital to the streaming and social media industries that impact billions of viewers daily. Although previous NR-IQA methods leveraged different feature extraction approaches, the performance bottleneck still exists. In this paper, we propose a simple and yet effective general-purpose no-reference (NR) image quality assessment (IQA) framework based on multi-task learning. Our model employs distortion types as well as subjective human scores to predict image quality. We propose a feature fusion method to utilize distortion information to improve the quality score estimation task. In our experiments, we demonstrate that by utilizing multi-task learning and our proposed feature fusion method, our model yields better performance for the NR-IQA task. To demonstrate the effectiveness of our approach, we test our approach on seven standard datasets and show that we achieve state-of-the-art results on various datasets.
研究动机与目标
- 解决无参考图像质量评估(NR-IQA)中的挑战,即在无参考图像可用的情况下进行评估,这对流媒体和社交媒体平台具有关键意义。
- 克服现有基于手工设计特征的方法在屏幕内容和 HDR 图像等多样化图像类型上泛化能力差的局限性。
- 通过多任务学习联合学习质量得分回归与失真类型分类,提升通用型无参考图像质量评估的性能。
- 设计一种特征融合机制,通过引入与失真相关的特定信息来增强质量估计能力。
- 在包括自然图像、屏幕内容和 HDR 处理图像在内的多样化图像领域中,展示模型的鲁棒性与泛化能力。
提出的方法
- 采用深度卷积神经网络(如 VGG16)作为主干网络,从图像块中提取分层特征。
- 实施双分支多任务学习设置:一个分支用于预测主观图像质量得分(MOS/DMOS),另一个分支用于分类失真类型(如 JPEG、模糊、噪声)。
- 引入一个特征融合模块,将来自网络不同层的特征进行拼接,以增强两个任务的表征学习能力。
- 在质量得分回归分支中使用 1×1 卷积和全局平均池化(GAP)以降低维度并提升泛化能力。
- 使用 Adam 优化器,通过结合回归损失(用于质量得分)和交叉熵损失(用于失真类型分类)的联合损失函数进行端到端训练。
- 以 128×128 图像块作为输入,消融研究评估了图像块大小、优化器(SGD 与 Adam)以及主干网络深度(VGG16 与 VGG19)的影响。
实验结果
研究问题
- RQ1与单任务方法相比,联合预测图像质量得分和失真类型是否能提升无参考图像质量评估的性能?
- RQ2在质量预测与失真预测分支之间进行特征融合,是否能增强模型在多样化失真类型和图像内容上的泛化能力?
- RQ3主干网络的选择(如 VGG16 与 VGG19)以及输入图像块大小如何影响模型性能与泛化能力?
- RQ4通过失真类型监督的多任务学习是否能减少过拟合并提升在有限训练数据上的鲁棒性?
- RQ5所提出方法是否能有效泛化到非自然图像领域,如屏幕内容和 HDR 处理图像?
主要发现
- 所提出的多任务模型(QualNet)在使用 VGG16 的 TID2013 数据集上,SROCC 达到 0.916,LCC 达到 0.936,优于单任务和非融合多任务基线模型。
- 使用 VGG19 作为主干网络可进一步提升性能,在 LIVE-MD1 数据集上达到 SROCC 0.925 和 LCC 0.945。
- 消融研究证实,特征融合显著提升性能,所提模型(f)优于无融合模型(如模型-e:SROCC 0.906,LCC 0.920)。
- 使用 Adam 优化器训练的模型泛化能力优于 SGD,相关性指标更高(如在 TID2013 上 SROCC 0.916 vs. 0.909)。
- 较小的图像块尺寸导致性能下降:SROCC 从 128×128 的 0.916 降至 64×64 的 0.891 和 32×32 的 0.878,表明更大的图像块能保留更多结构信息。
- 模型在 SIQAD 数据集上实现了高达 98% 的失真类型预测准确率,表明其能有效解耦失真特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。