Skip to main content
QUICK REVIEW

[论文解读] Automatic Image Cropping for Visual Aesthetic Enhancement Using Deep Neural Networks and Cascaded Regression

Guanjun Guo, Hanzi Wang|arXiv (Cornell University)|Dec 25, 2017
Visual Attention and Saliency Detection参考文献 31被引用 6
一句话总结

本文提出一种级联裁剪回归(CCR)方法,利用深度卷积神经网络(CNN)特征与梯度提升随机蕨回归器,自动裁剪图像以提升视觉美感。通过采用两阶段学习策略——先在大规模美学数据集上训练CNN,再从CNN特征回归裁剪框——该方法在性能上优于当前最先进方法,失败率在4.3%–6.3%之间,单张图像推理时间为1.7秒。

ABSTRACT

Despite recent progress, computational visual aesthetic is still challenging. Image cropping, which refers to the removal of unwanted scene areas, is an important step to improve the aesthetic quality of an image. However, it is challenging to evaluate whether cropping leads to aesthetically pleasing results because the assessment is typically subjective. In this paper, we propose a novel cascaded cropping regression (CCR) method to perform image cropping by learning the knowledge from professional photographers. The proposed CCR method improves the convergence speed of the cascaded method, which directly uses random-ferns regressors. In addition, a two-step learning strategy is proposed and used in the CCR method to address the problem of lacking labelled cropping data. Specifically, a deep convolutional neural network (CNN) classifier is first trained on large-scale visual aesthetic datasets. The deep CNN model is then designed to extract features from several image cropping datasets, upon which the cropping bounding boxes are predicted by the proposed CCR method. Experimental results on public image cropping datasets demonstrate that the proposed method significantly outperforms several state-of-the-art image cropping methods.

研究动机与目标

  • 解决自动图像裁剪在视觉美感增强中的挑战,其中美感质量具有主观性且难以量化。
  • 通过利用大规模弱标签美学数据集预训练CNN,克服裁剪标注数据稀缺的问题。
  • 通过使用梯度提升随机蕨作为基学习器,提升级联回归的收敛速度与精度。
  • 设计两阶段学习流程:首先通过预训练CNN提取判别性特征,然后回归最优裁剪区域。
  • 实现高质量裁剪结果,即使在有限边界框监督下,也能与专业摄影师的标注高度一致。

提出的方法

  • 在大规模美学数据集(AVA)上训练深度卷积神经网络(CNN)分类器,以学习图像的判别性表征。
  • 使用预训练CNN从图像裁剪区域提取CNN特征,将这些特征作为裁剪回归任务的输入。
  • 实现级联回归框架,其中每个阶段使用一组弱随机蕨回归器,并通过梯度提升进行优化以提升收敛性。
  • 采用两阶段学习策略:先在图像级美学标签上预训练CNN,再使用专业摄影师提供的边界框标注微调回归头。
  • 通过多阶段回归迭代优化,应用训练好的CCR模型预测最优裁剪区域。
  • 通过利用CNN提取的高层语义特征,引导定位美学上令人满意的区域,从而优化回归过程。

实验结果

研究问题

  • RQ1两阶段学习策略是否能有效弥合弱标签美学数据与有限边界框裁剪标注之间的差距?
  • RQ2与标准级联回归中的随机蕨相比,采用梯度提升随机蕨的级联回归在收敛性和精度方面有何提升?
  • RQ3从预训练美学分类器中提取的CNN特征在多大程度上能提升自动图像裁剪的性能?
  • RQ4在公开裁剪数据集上,该方法在IoU与BDE指标上与SOTA方法相比表现如何?
  • RQ5哪些类型的图像对所提方法最具挑战性?其失败模式是什么?

主要发现

  • 所提出的CCR方法在三个公开图像裁剪数据集上,于IoU与BDE指标上均显著优于四种SOTA方法。
  • 该方法在三个测试数据集上的失败率仅为4.3%–6.3%,表明其在预测专业级裁剪区域方面具有高度可靠性。
  • 单张图像的平均推理时间为1.7秒,远快于同类改进型基于变化的方法所报告的11秒。
  • 基于注意力的方法表现最差,因其过度关注显著物体而忽略了整体美学构图。
  • 基于美学的方法表现不佳,因其优先考虑高质量局部区域,而非整体构图,而CCR方法则从专业裁剪模式中学习。
  • 失败案例主要出现在物体靠近图像边界时(存在部分裁剪风险),或背景均匀且无纹理时,表明其在边缘与结构建模方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。