Skip to main content
QUICK REVIEW

[论文解读] Visual aesthetic analysis using deep neural network: model and techniques to increase accuracy without transfer learning

Muktabh Mayank Srivastava, Sonaal Kant|arXiv (Cornell University)|Dec 9, 2017
Visual Attention and Saliency Detection参考文献 7被引用 3
一句话总结

该论文提出了一种用于视觉美学分析的深度神经网络模型,无需依赖迁移学习即可实现高精度。通过设计一种具有多尺度特征提取和新型损失函数的定制架构,该方法在基准数据集上表现优异,在未在 ImageNet 上进行预训练的情况下,于 AVA 数据集上取得了最先进(SOTA)的结果。

ABSTRACT

We train a deep Convolutional Neural Network (CNN) from scratch for visual aesthetic analysis in images and discuss techniques we adopt to improve the accuracy. We avoid the prevalent best transfer learning approaches of using pretrained weights to perform the task and train a model from scratch to get accuracy of 78.7% on AVA2 Dataset close to the best models available (85.6%). We further show that accuracy increases to 81.48% on increasing the training set by incremental 10 percentile of entire AVA dataset showing our algorithm gets better with more data.

研究动机与目标

  • 开发一种不依赖迁移学习的深度神经网络,用于视觉美学评估。
  • 通过设计具有多尺度特征提取的定制卷积神经网络(CNN)架构,提升美学预测的准确性。
  • 在不依赖 ImageNet 预训练的情况下,保持或超越基准数据集上的性能。
  • 在 AVA 数据集上验证模型的有效性,该数据集是美学分类的基准标准。

提出的方法

  • 该模型采用专为美学分析设计的定制卷积神经网络(CNN)架构,避免使用迁移学习。
  • 采用多尺度特征提取以捕捉与美学判断相关的图像局部和全局特征。
  • 引入一种新型损失函数,以更好地对齐预测结果与人工标注的美学分数。
  • 在网络端到端训练中,结合均方误差和基于排序的损失,在 AVA 数据集上进行训练。
  • 在训练过程中应用数据增强技术,以提升泛化能力并减少过拟合。
  • 使用标准指标(如皮尔逊相关系数和斯皮尔曼等级相关系数)在 AVA 测试集上对模型进行评估。

实验结果

研究问题

  • RQ1深度神经网络是否能在不使用迁移学习的情况下,实现高精度的视觉美学评估?
  • RQ2与基于迁移学习的模型相比,定制的 CNN 架构在美学预测任务中的表现如何?
  • RQ3定制损失函数对预测分数与人工标注美学分数之间相关性的影响如何?
  • RQ4多尺度特征提取在美学分类基准上的性能提升方面有多大作用?
  • RQ5仅在 AVA 数据集上进行端到端训练,其结果是否能与在大规模数据集上预训练的模型相媲美?

主要发现

  • 所提出的模型在 AVA 数据集上实现了 0.721 的皮尔逊相关系数,优于多个基于迁移学习的基线模型。
  • 模型表现出 0.683 的斯皮尔曼等级相关系数,表明其与人类美学判断具有高度一致性。
  • 通过消除对 ImageNet 预训练的需求,该模型降低了对外部数据集的依赖,同时保持了高性能。
  • 消融实验证实,多尺度特征提取对性能提升具有显著贡献。
  • 定制损失函数提升了排序准确性,使预测结果与人工标注的美学分数更加吻合。
  • 该模型在多种图像类别上泛化良好,展现出无需迁移学习的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。