[论文解读] Learning to Blindly Assess Image Quality in the Laboratory and Wild
该论文提出了一种统一的无参考图像质量评估(BIQA)模型,通过在多个IQA数据库上端到端训练,并采用一种新颖的成对学习排序策略。通过在每个数据库内构建图像对,并使用基于人类主观评价的连续质量标注,该模型在合成与真实失真场景下均实现了最先进性能,通过保真度损失优化和跨数据库泛化能力,显著优于以往方法。
Computational models for blind image quality assessment (BIQA) are typically trained in well-controlled laboratory environments with limited generalizability to realistically distorted images. Similarly, BIQA models optimized for images captured in the wild cannot adequately handle synthetically distorted images. To face the cross-distortion-scenario challenge, we develop a BIQA model and an approach of training it on multiple IQA databases (of different distortion scenarios) simultaneously. A key step in our approach is to create and combine image pairs within individual databases as the training set, which effectively bypasses the issue of perceptual scale realignment. We compute a continuous quality annotation for each pair from the corresponding human opinions, indicating the probability of one image having better perceptual quality. We train a deep neural network for BIQA over the training set of massive image pairs by minimizing the fidelity loss. Experiments on six IQA databases demonstrate that the optimized model by the proposed training strategy is effective in blindly assessing image quality in the laboratory and wild, outperforming previous BIQA methods by a large margin.
研究动机与目标
- 解决在合成失真与真实失真上训练的BIQA模型之间的泛化差距。
- 消除在不同MOS范围的多样化IQA数据库之间进行感知尺度重校准的需求。
- 开发一种统一的BIQA模型,使其在实验室(合成)与野外(真实)失真场景下均表现优异。
- 实现使用与模型无关、可扩展的策略,同时在多个数据库上进行端到端训练。
提出的方法
- 在每个独立的IQA数据库内构建图像对,形成统一的训练集,从而避免感知尺度重校准的需要。
- 基于人类主观评价差异(DMOS)计算每对图像的连续质量标注,表示一张图像具有更高感知质量的概率。
- 使用保真度损失函数训练深度神经网络,以最小化预测质量分数与连续质量分数之间的差异。
- 通过在六个IQA数据库(LIVE、CSIQ、TID2013、BID、LIVE Challenge、KonIQ-10K)上采用联合训练策略,提升对多样化失真类型的鲁棒性。
- 利用预训练的ImageNet权重,防止过拟合并提升对未见失真类型的泛化能力。
- 使用成对排序信号进行端到端优化,使模型能够同时学习合成与真实失真模式。
实验结果
研究问题
- RQ1单一BIQA模型是否能在无需单独微调的情况下,同时在合成与真实图像失真上实现优越性能?
- RQ2如何有效整合感知尺度不一致的多个IQA数据库以实现联合训练?
- RQ3使用基于成对人类判断的连续质量标注,是否相比绝对MOS或二元排序能提升泛化能力?
- RQ4保真度损失函数是否能优于标准交叉熵损失,以学习感知对齐的质量预测?
- RQ5在包含多样化失真的多个数据库上进行联合训练,相比在单一数据库上训练,能在多大程度上提升泛化能力?
主要发现
- 所提出的模型在所有六个测试数据库上均优于以往所有BIQA方法,包括合成失真(LIVE、CSIQ、TID2013)与真实失真(BID、LIVE Challenge、KonIQ-10K)数据集。
- 尽管为无参考模型且未使用原始参考图像进行训练,该模型性能接近全参考指标如MS-SSIM与NLPD。
- 将保真度损失替换为交叉熵损失后,合成数据库上的性能显著下降,证明了连续质量监督的优越性。
- 在跨数据库评估中,该模型对未见失真类型具有出色的泛化能力,甚至优于在TID2013与LIVE Challenge上分别训练的DB-CNN。
- 消融实验证实,MOS线性重标定会引入噪声并降低性能,验证了所提出的成对连续标注策略的有效性。
- 在包含多样化失真的多个数据库上进行联合训练可提供相互正则化,引导网络收敛至更优的局部最优解,增强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。