Skip to main content
QUICK REVIEW

[论文解读] Revisiting Image Aesthetic Assessment via Self-Supervised Feature Learning

Kekai Sheng, Weiming Dong|arXiv (Cornell University)|Nov 26, 2019
Visual Attention and Saliency Detection参考文献 58被引用 7
一句话总结

本文提出了一种用于图像美学评估的自监督学习框架,利用合成图像操作作为代理任务,无需人工标注即可学习美学感知特征。通过训练以识别退化类型和参数,该方法在AVA和AADB基准上的性能与ImageNet预训练模型相当,优于其他自监督基线方法,并减少了对大规模标注数据的依赖。

ABSTRACT

Visual aesthetic assessment has been an active research field for decades. Although latest methods have achieved promising performance on benchmark datasets, they typically rely on a large number of manual annotations including both aesthetic labels and related image attributes. In this paper, we revisit the problem of image aesthetic assessment from the self-supervised feature learning perspective. Our motivation is that a suitable feature representation for image aesthetic assessment should be able to distinguish different expert-designed image manipulations, which have close relationships with negative aesthetic effects. To this end, we design two novel pretext tasks to identify the types and parameters of editing operations applied to synthetic instances. The features from our pretext tasks are then adapted for a one-layer linear classifier to evaluate the performance in terms of binary aesthetic classification. We conduct extensive quantitative experiments on three benchmark datasets and demonstrate that our approach can faithfully extract aesthetics-aware features and outperform alternative pretext schemes. Moreover, we achieve comparable results to state-of-the-art supervised methods that use 10 million labels from ImageNet.

研究动机与目标

  • 解决图像美学评估数据集中人工标注稀缺性和偏差的问题。
  • 探索自监督表示学习作为美学特征学习中监督预训练的替代方案。
  • 设计基于图像操作对美学感知影响的感知性代理任务。
  • 通过基于熵的图像块加权策略提升训练效率和信号质量。
  • 证明自监督特征可在美学基准上达到或超过大规模监督预训练模型的性能。

提出的方法

  • 设计两种新颖的代理任务:(1) 识别图像块上应用的图像编辑操作类型,(2) 回归此类操作的参数值。
  • 使用一组专家设计的图像操作——如模糊、像素化、图像块置换和相机抖动——这些操作已知会降低图像美学质量。
  • 使用对比学习目标在这些代理任务上训练主干网络(如ResNet-18),以学习可迁移的特征。
  • 应用基于熵的加权策略,在训练过程中降低低信号图像块的权重,从而提升训练稳定性和效率。
  • 使用单一线性分类器在真实美学标签上微调所学特征,实现二分类任务。
  • 仅使用合成的、弱标注的图像块进行预训练,完全避免在预训练阶段使用人工标注的美学评分。

实验结果

研究问题

  • RQ1基于图像退化操作的自监督代理任务能否有效学习与人类美学感知相关的特征?
  • RQ2在下游美学分类准确率方面,联合学习多个与退化相关的代理任务与单任务预训练相比表现如何?
  • RQ3基于熵的图像块加权策略在自监督美学特征学习中在多大程度上提升了训练效率和模型性能?
  • RQ4在无任何人工美学标签的情况下训练的自监督特征能否在美学基准上实现与ImageNet预训练模型相当的性能?
  • RQ5哪些类型的图像操作对学习美学感知表征的贡献最为显著?

主要发现

  • 所提出的自监督方法在CUHKPQ数据集上达到88.5%的准确率,在AADB数据集上达到69.2%的准确率,仅使用美学标签进行微调,性能与ImageNet预训练模型相当。
  • 在AVA基准上,该方法使用线性头达到80.1%的准确率,与使用1000万ImageNet标签的最先进全监督模型性能相当。
  • 在退化类型和参数预测任务上联合预训练的性能比单独使用任一任务提高0.3–0.7%,表明两者具有互补优势。
  • 从训练中排除相机抖动或柔和/颗粒感效果时,性能下降最大(AVA和AADB上下降0.3–0.6%),表明这些操作与美学感知有强相关性。
  • 基于熵的加权策略至少提升了0.5%的性能,并稳定了训练过程,防止了特征学习中的不良动态。
  • 该方法在所有三个基准上均优于标准自监督基线方法,如上下文预测、拼图游戏、色彩化和旋转预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。