Skip to main content
QUICK REVIEW

[论文解读] Weakly- and Self-Supervised Learning for Content-Aware Deep Image Retargeting

Donghyeon Cho, Jinsun Park|arXiv (Cornell University)|Aug 9, 2017
Visual Attention and Saliency Detection参考文献 43被引用 10
一句话总结

该论文提出了一种基于图像级标注的弱监督与自监督深度学习方法,用于内容感知图像重定域。该方法通过一维重复卷积和累积归一化生成偏移图,以在最小化失真的同时保留显著内容,实现了端到端训练,无需像素级监督,达到了最先进性能。

ABSTRACT

This paper proposes a weakly- and self-supervised deep convolutional neural network (WSSDCNN) for content-aware image retargeting. Our network takes a source image and a target aspect ratio, and then directly outputs a retargeted image. Retargeting is performed through a shift map, which is a pixel-wise mapping from the source to the target grid. Our method implicitly learns an attention map, which leads to a content-aware shift map for image retargeting. As a result, discriminative parts in an image are preserved, while background regions are adjusted seamlessly. In the training phase, pairs of an image and its image-level annotation are used to compute content and structure losses. We demonstrate the effectiveness of our proposed method for a retargeting application with insightful analyses.

研究动机与目标

  • 开发一种内容感知图像重定域方法,在调整长宽比的同时保留重要图像内容。
  • 通过仅使用图像级标注进行监督,减少对昂贵像素级标注的依赖。
  • 实现深度网络的端到端训练,直接生成重定域图像。
  • 通过结构损失和专用网络层,最小化失真和抖动等视觉伪影。
  • 提升在复杂内容或无主导物体图像上的泛化能力和鲁棒性。

提出的方法

  • 该方法使用深度编码器-解码器网络,从图像级标注中隐式学习语义注意力图。
  • 通过一维重复卷积和累积归一化,利用偏移层将每个源像素映射到目标网格,生成内容感知偏移图。
  • 基于重定域图像上的图像级标注计算内容损失,以保留语义内容。
  • 在输入图像上应用结构损失,以抑制失真和抖动等视觉伪影。
  • 网络通过图像级标签的弱监督和结构损失的自监督进行端到端训练。
  • 通过一次前向传播,直接从输入图像和目标长宽比生成重定域图像。

实验结果

研究问题

  • RQ1深度神经网络能否仅使用图像级标注而非像素级标签,学习到内容感知的图像重定域?
  • RQ2基于隐式注意力学习的偏移图在重定域过程中对显著内容的保留效果如何?
  • RQ3结构损失与一维重复卷积能否有效减少抖动和失真等视觉伪影?
  • RQ4与传统重定域技术(如缝合切除法和裁剪)相比,该方法在视觉质量和语义保留方面表现如何?
  • RQ5与原始图像相比,该方法在重定域图像上保持分类准确性的程度如何?

主要发现

  • 在用户研究中,该方法获得了最高用户偏好,七种对比方法中得票最多。
  • 在所有从 0.3 到 0.7 的缩放比例下,重定域图像的 mAP 比值显著高于基线方法(中心裁剪、边缘裁剪、缝合切除法)。
  • 随着图像尺寸减小,该方法的 mAP 比值衰减更慢,表明对主要图像内容的保留更优。
  • 通过结构损失和一维重复卷积层,网络成功减少了抖动和失真等视觉伪影。
  • 该方法在无主导物体的图像上泛化良好,通过纹理区域的响应保持了合理性能。
  • 仅使用图像级标注进行端到端训练被证明有效,无需大规模像素级标注数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。