Skip to main content
QUICK REVIEW

[论文解读] An End-to-End Neural Network for Image Cropping by Learning Composition from Aesthetic Photos

Peng Lu, Hao Zhang|arXiv (Cornell University)|Jul 2, 2019
Visual Attention and Saliency Detection被引用 12
一句话总结

该论文提出了一种端到端的深度学习框架,用于自动图像裁剪,通过学习显著物体与高审美区域之间的空间关系,直接预测最优裁剪区域。该方法采用基于U-Net的显著性检测器、候选区域生成层以及轻量级回归网络,在准确率(以IoU和BDE衡量)和效率(50 fps)方面均达到最先进水平,同时消除了迭代候选区域评估的需要。

ABSTRACT

As one of the fundamental techniques for image editing, image cropping discards unrelevant contents and remains the pleasing portions of the image to enhance the overall composition and achieve better visual/aesthetic perception. In this paper, we primarily focus on improving the accuracy of automatic image cropping, and on further exploring its potential in public datasets with high efficiency. From this respect, we propose a deep learning based framework to learn the objects composition from photos with high aesthetic qualities, where an anchor region is detected through a convolutional neural network (CNN) with the Gaussian kernel to maintain the interested objects' integrity. This initial detected anchor area is then fed into a light weighted regression network to obtain the final cropping result. Unlike the conventional methods that multiple candidates are proposed and evaluated iteratively, only a single anchor region is produced in our model, which is mapped to the final output directly. Thus, low computational resources are required for the proposed approach. The experimental results on the public datasets show that both cropping accuracy and efficiency achieve the state-ofthe-art performances.

研究动机与目标

  • 开发一种端到端的神经网络,直接预测高审美裁剪区域,无需迭代生成候选区域。
  • 通过建模显著物体与高审美质量区域之间的关系,提高裁剪准确率。
  • 通过避免全面扫描或多次候选区域评估,提升计算效率。
  • 通过概率框架探索深度特征在图像构图与审美中的可解释性。
  • 实现实时性能,适用于消费级设备的部署。

提出的方法

  • 使用U型卷积神经网络(U-Net)生成突出显示图像中主要物体的显著性图。
  • 应用软二值化层以优化显著性图,将显著物体与背景分离。
  • 引入候选区域生成层,利用类似高斯的核函数以保持物体完整性,并定义单一初始候选区域。
  • 使用感兴趣区域(ROI)池化层从候选区域中提取特征以进行回归。
  • 利用轻量级回归网络,直接从候选区域特征预测最终的裁剪矩形。
  • 采用概率框架端到端训练整个流程,以同时优化定位准确率和审美质量。

实验结果

研究问题

  • RQ1从显著性到裁剪区域的单一、直接回归路径是否能优于多阶段候选区域生成与评估方法?
  • RQ2深度神经网络在多大程度上能学习显著物体与高审美图像构图之间的隐含关系?
  • RQ3在不损失准确率的前提下,消除迭代候选区域评估在多大程度上提升了计算效率?
  • RQ4所提出的基于高斯核的候选区域生成层如何保持物体完整性并改善定位性能?
  • RQ5该模型在保持客观指标与主观用户偏好高表现的前提下,能否在多样化数据集上实现良好泛化?

主要发现

  • 所提方法在公开数据集上达到最先进性能,在FLMS数据集上的平均IoU为0.78,BDE为0.81。
  • 系统平均处理速度达50帧每秒,适用于实时应用。
  • 该方法在[7]中的基线方法(依赖于暴力搜索候选区域)基础上快五倍。
  • 在主观用户研究中,该方法获得2000票中的792票,被评为最具审美吸引力的裁剪结果,优于AIC、A2-RL和VEN。
  • 失败案例主要出现在显著性稀疏的图像中(如FLMS),或存在多个显著物体且未完全对齐真实标注的情况(如FCD),表明在显著性检测和标注对齐方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。