[论文解读] Exploring CLIP for Assessing the Look and Feel of Images
本文提出 CLIP-IQA,一种零样本方法,利用 CLIP 模型中的视觉-语言先验,无需任务特定微调即可评估图像质量(外观)和抽象感知属性(感受)。通过使用反义提示对(如“好照片。”和“坏照片。”),该方法在多种 IQA 基准和抽象属性上与人类感知表现出高度相关性,优于非学习方法,并在合成数据集上达到或超过基于学习的模型性能。
Measuring the perception of visual content is a long-standing problem in computer vision. Many mathematical models have been developed to evaluate the look or quality of an image. Despite the effectiveness of such tools in quantifying degradations such as noise and blurriness levels, such quantification is loosely coupled with human language. When it comes to more abstract perception about the feel of visual content, existing methods can only rely on supervised models that are explicitly trained with labeled data collected via laborious user study. In this paper, we go beyond the conventional paradigms by exploring the rich visual language prior encapsulated in Contrastive Language-Image Pre-training (CLIP) models for assessing both the quality perception (look) and abstract perception (feel) of images in a zero-shot manner. In particular, we discuss effective prompt designs and show an effective prompt pairing strategy to harness the prior. We also provide extensive experiments on controlled datasets and Image Quality Assessment (IQA) benchmarks. Our results show that CLIP captures meaningful priors that generalize well to different perceptual assessments. Code is avaliable at https://github.com/IceClear/CLIP-IQA.
研究动机与目标
- 开发一种无需任务特定训练即可评估图像质量(外观)和抽象感知属性(感受)的零样本方法。
- 探究 CLIP 的预训练视觉-语言先验是否能泛化到超越客观图像属性的多样化感知评估。
- 通过系统化的提示设计策略,解决基于 CLIP 的感知评估中的语言歧义和提示敏感性问题。
- 在真实世界和合成 IQA 数据集上评估该方法的性能,包括细微质量属性和抽象感知属性。
- 证明 CLIP 可作为跨质量与美学维度的通用感知评估工具。
提出的方法
- 该方法利用 CLIP 的视觉-语言嵌入空间,将图像特征与成对的反义提示(如“好照片。”和“坏照片。”)进行比较,以推断感知分数。
- 提出一种提示配对策略,以减少语言歧义并提高一致性,其中每个属性均通过一对对比提示进行评估(如“快乐”与“悲伤”)。
- 在质量感知方面,该方法在标准 IQA 数据集(如 TID2013、KonIQ-10k)上应用 CLIP,使用“明亮”与“昏暗”等提示评估细微属性。
- 在抽象感知方面,该方法在 AVA 数据集上使用“复杂”与“简单”等提示评估“美学”、“情感基调”和“复杂性”等属性。
- 最终分数通过计算两个反义提示在 CLIP 的 logit 分数之间的归一化差值获得,作为感知质量或感受的代理指标。
- 引入一个微调变体 CLIP-IQA+,通过使用标注数据微调分类器头,进一步提升在合成基准上的性能。
实验结果
研究问题
- RQ1CLIP 的预训练视觉-语言先验是否可被有效利用,以在无需任何任务特定微调的情况下评估图像质量?
- RQ2提示设计的选择,特别是反义提示配对,如何影响感知评估的一致性和准确性?
- RQ3CLIP 是否能泛化到缺乏明确可量化指标的抽象感知属性(如情绪、美学和复杂性)?
- RQ4CLIP-IQA 在真实世界和合成数据集上与现有基于学习和非学习的 IQA 方法相比表现如何?
- RQ5反义提示策略在多大程度上能缓解视觉感知评估中的语言歧义?
主要发现
- 在 TID2013 合成 IQA 基准上,CLIP-IQA 实现了斯皮尔曼等级相关系数(SROCC)0.632 和皮尔逊线性相关系数(PLCC)0.692,优于非学习方法,并与最先进基于学习的模型持平。
- 在 KonIQ-10k 数据集上,CLIP-IQA 在整体图像质量方面实现 SROCC 0.51 和 PLCC 0.571,展现出与人类感知的高度一致,且无需任何微调。
- 该方法成功捕捉了细微质量属性,如亮度、噪声和锐度,在合成数据中,CLIP-IQA 对属性变化表现出正相关性,如图 8 所示。
- 在抽象感知方面,CLIP-IQA 在 AVA 数据集上对“快乐/悲伤”、“恐怖/平静”和“美丽/丑陋”等属性实现了稳定且有意义的评分,结果如图 9 和图 10 所示。
- 微调变体 CLIP-IQA+ 在 TID2013 上实现 SROCC 0.632 和 PLCC 0.692,甚至超越了 MUSIQ 和 HyperIQA 等基于学习的方法。
- 反义提示配对策略显著提升了性能稳定性与人类判断的相关性,尤其在语言歧义情境下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。