Skip to main content
QUICK REVIEW

[论文解读] Reliable and Efficient Image Cropping: A Grid Anchor based Approach

Hui Zeng, Lida Li|arXiv (Cornell University)|Apr 9, 2019
Advanced Image and Video Retrieval Techniques参考文献 39被引用 8
一句话总结

本文提出一种基于网格锚点的图像裁剪方法,将候选裁剪区域的搜索空间从数百万减少至100个以内,从而建立了一个新基准,涵盖1,236张图像中的106,860个标注裁剪区域。该方法采用轻量化、高效的网络,在标准硬件上实现125 FPS的推理速度,显著优于以往方法在准确率和速度方面的表现,同时解决了IoU评估指标不可靠以及人类标注稀疏的问题。

ABSTRACT

Image cropping aims to improve the composition as well as aesthetic quality of an image by removing extraneous content from it. Existing image cropping databases provide only one or several human-annotated bounding boxes as the groundtruth, which cannot reflect the non-uniqueness and flexibility of image cropping in practice. The employed evaluation metrics such as intersection-over-union cannot reliably reflect the real performance of cropping models, either. This work revisits the problem of image cropping, and presents a grid anchor based formulation by considering the special properties and requirements (e.g., local redundancy, content preservation, aspect ratio) of image cropping. Our formulation reduces the searching space of candidate crops from millions to less than one hundred. Consequently, a grid anchor based cropping benchmark is constructed, where all crops of each image are annotated and more reliable evaluation metrics are defined. We also design an effective and lightweight network module, which simultaneously considers the region of interest and region of discard for more accurate image cropping. Our model can stably output visually pleasing crops for images of different scenes and run at a speed of 125 FPS. Code and dataset are available at: https://github.com/HuiZeng/Grid-Anchor-based-Image-Cropping.

研究动机与目标

  • 解决现有图像裁剪基准仅对每张图像提供一个或少数几个由人类标注的裁剪区域,无法反映现实世界中裁剪的非唯一性和灵活性的问题。
  • 克服标准指标(如IoU)不可靠的问题,这些指标可能将视觉上不悦目的裁剪区域排在视觉更优的裁剪之前。
  • 通过网格锚点公式将候选裁剪区域的庞大搜索空间(从数百万减少至100个以内)大幅缩减,以实现高效且有效的学习。
  • 开发一种轻量化、高速的模型,能够在多样化场景和不同长宽比下生成视觉上令人愉悦的裁剪结果。
  • 构建一个全新的、全面的基准数据集,包含密集的裁剪标注和可靠的评估指标,以实现对模型性能的客观比较。

提出的方法

  • 提出一种基于网格锚点的公式化方法,将图像离散化为固定网格的候选裁剪区域,将搜索空间从数百万减少至每张图像少于100个。
  • 设计一种新颖的轻量化CNN裁剪模块,联合建模感兴趣区域与应舍弃的区域,以提升裁剪选择效果。
  • 构建一个新基准,包含1,236张源图像和106,860个标注裁剪区域,覆盖多样化场景和长宽比,采用两阶段标注策略以确保可靠性。
  • 定义两种新评估指标——top-k准确率和一种新型基于排序的指标,使用可靠的成对比较替代IoU,以更真实地反映视觉美感。
  • 采用两阶段训练流程:首先在可靠的成对排名数据上训练视图评估网络(VEN),然后利用其预测结果监督训练更快速的视图生成网络(VPN)用于推理。
  • 通过利用缩减后的搜索空间和高效的网络结构,优化推理速度,在标准硬件上实现125 FPS的推理速度。

实验结果

研究问题

  • RQ1基于网格锚点的公式化方法是否能显著减少图像裁剪的搜索空间,同时保持视觉质量和灵活性?
  • RQ2密集的多裁剪标注基准是否能比单裁剪或少数裁剪标注提供更可靠的模型评估?
  • RQ3在新基准上训练的轻量化端到端网络是否能在准确率和推理速度两方面均超越现有最先进模型?
  • RQ4IoU是否是评估图像裁剪模型的可靠指标,尤其当视觉上更优的裁剪区域IoU反而较低时?
  • RQ5通过成对排名监督训练的模型是否能良好泛化至多样化长宽比和图像构图?

主要发现

  • 所提出的基于网格锚点的方法将每张图像的候选裁剪区域数量从数百万减少至100个以内,实现了高效且可扩展的学习。
  • 新基准包含1,236张源图像和106,860个标注裁剪区域,为评估提供了全面且可靠的训练数据集。
  • 模型实现125 FPS的推理速度,显著优于竞争对手,如A2-RL(通过迭代优化裁剪区域)和VFN/VDN(逐个处理裁剪区域)。
  • 在定量指标上,所提方法在top-1、top-5和top-10准确率上大幅超越VEN、VFN和A2-RL。
  • 该模型在多样化场景(包括单对象、多对象、建筑和景观图像)下,针对不同长宽比,始终能生成视觉上令人愉悦的裁剪结果。
  • 基于可靠成对比较的新评估指标表明,即使强基线模型(如Baseline_N和Baseline_C)在IoU指标下表现优于许多近期模型,也凸显了IoU作为评估指标的不可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。