Skip to main content
QUICK REVIEW

[论文解读] Image Resizing by Reconstruction from Deep Features

Moab Arar, Dov Danon|arXiv (Cornell University)|Apr 17, 2019
Visual Attention and Saliency Detection参考文献 31被引用 5
一句话总结

本文提出了一种名为深度网络重缩放(DNR)的新颖图像重定向方法,该方法通过使用预训练卷积神经网络(CNN)提取的深度特征,在特征空间中而非像素空间中执行图像缩放。通过优化从高层语义特征重建图像的过程,DNR减少了视觉伪影并更好地保留了重要对象,在基准数据集上的语义保留和视觉质量方面均优于传统方法。

ABSTRACT

Traditional image resizing methods usually work in pixel space and use various saliency measures. The challenge is to adjust the image shape while trying to preserve important content. In this paper we perform image resizing in feature space where the deep layers of a neural network contain rich important semantic information. We directly adjust the image feature maps, extracted from a pre-trained classification network, and reconstruct the resized image using a neural-network based optimization. This novel approach leverages the hierarchical encoding of the network, and in particular, the high-level discriminative power of its deeper layers, that recognizes semantic objects and regions and allows maintaining their aspect ratio. Our use of reconstruction from deep features diminishes the artifacts introduced by image-space resizing operators. We evaluate our method on benchmarks, compare to alternative approaches, and demonstrate its strength on challenging images.

研究动机与目标

  • 解决依赖低层显著性度量并引入视觉伪影的传统图像缩放方法的局限性。
  • 利用深度神经网络特征中的高层语义信息,实现更精确的内容感知缩放。
  • 通过基于优化的深度特征重建而非直接的像素操作,减少缩放图像中的视觉伪影。
  • 通过利用预训练VGG-19网络的分层特征表示,提升图像重定向过程中的语义保留能力。

提出的方法

  • 该方法直接在预训练VGG-19网络的深层卷积层(如block5_conv1)的特征图上应用缝合雕刻缩放操作。
  • 通过基于反向传播的优化过程重建最终的缩放图像,以最小化重建损失并保持语义结构。
  • 通过可微分的网格采样层进行优化,进一步减少伪影,实现像素级映射的优化。
  • 图像区域的重要性通过深层特征的激活幅值推断得出,作为语义重要性图。
  • 通过自适应阈值根据特征激活水平在缝合雕刻和变形操作之间动态切换,结合多种操作。
  • 端到端的优化使网络能够从深度特征中学习自然外观的图像重建。

实验结果

研究问题

  • RQ1预训练CNN的深层特征能否提供比传统低层显著性度量更准确的语义重要性图?
  • RQ2在特征空间而非像素空间中执行图像缩放,是否能更好地保留语义内容?
  • RQ3与标准缩放算子相比,基于优化的深层特征重建能否减少视觉伪影?
  • RQ4语义引导与重建的结合相比现有方法,能否显著提升图像重定向质量?

主要发现

  • 在RetargetMe基准测试中,DNR在语义得分上达到最高平均分(70%),优于所有对比方法,包括人工裁剪和线性缩放。
  • 在用户偏好研究中,与表现最佳的替代方法相比,DNR在889张图像中有42张(4.7%)更受青睐;与每张图像的最佳结果相比,956票中有37票(3.9%)选择DNR。
  • 视觉伪影显著减少,如图1中自行车图像所示,重建质量提升且复杂场景中的过渡更加平滑。
  • DNR在语义保留方面表现卓越,在RetargetMe数据集上达到最高平均语义得分(70%),表明在深层特征空间中对重要特征的强保留能力。
  • 尽管具有优势,该方法计算开销较大,单张640×480图像的处理时间长达两分钟,限制了实时应用。
  • 当VGG-19网络未能检测到重要语义区域(如人物肖像中的手部)时,观察到输出出现失真。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。