Skip to main content
QUICK REVIEW

[论文解读] Automatic Photo Adjustment Using Deep Neural Networks

Zhicheng Yan, Hao Zhang|arXiv (Cornell University)|Dec 24, 2014
Advanced Image and Video Retrieval Techniques参考文献 26被引用 4
一句话总结

本文提出了一种基于深度学习的自动照片调整方法,通过从图像范例中学习复杂且空间可变的颜色与色调变换。通过结合像素级、上下文和全局特征与深度神经网络,该方法实现了语义感知的增强效果,在定性和定量评估中均优于先前方法,尤其在建模内容依赖性调整方面表现突出。

ABSTRACT

Photo retouching enables photographers to invoke dramatic visual impressions by artistically enhancing their photos through stylistic color and tone adjustments. However, it is also a time-consuming and challenging task that requires advanced skills beyond the abilities of casual photographers. Using an automated algorithm is an appealing alternative to manual work but such an algorithm faces many hurdles. Many photographic styles rely on subtle adjustments that depend on the image content and even its semantics. Further, these adjustments are often spatially varying. Because of these characteristics, existing automatic algorithms are still limited and cover only a subset of these challenges. Recently, deep machine learning has shown unique abilities to address hard problems that resisted machine algorithms for long. This motivated us to explore the use of deep learning in the context of photo editing. In this paper, we explain how to formulate the automatic photo adjustment problem in a way suitable for this approach. We also introduce an image descriptor that accounts for the local semantics of an image. Our experiments demonstrate that our deep learning formulation applied using these descriptors successfully capture sophisticated photographic styles. In particular and unlike previous techniques, it can model local adjustments that depend on the image semantics. We show on several examples that this yields results that are qualitatively and quantitatively better than previous work.

研究动机与目标

  • 为解决自动艺术化照片增强的挑战,该挑战传统上需要专家手动操作,且由于复杂、非线性和空间可变的调整而难以建模。
  • 将语义意识融入自动照片增强中,使调整能够基于图像内容(如人物、物体或场景)而变化。
  • 开发一种可扩展的深度学习框架,能够利用大规模、高维数据建模输入图像与增强图像之间的高度非线性映射。
  • 通过从图像对(调整前/后)中学习来改进现有自动增强技术,这些图像对反映了艺术风格,包括细微且感知驱动的调整。
  • 通过利用具有丰富多级特征描述符的深度神经网络,在定性和定量评估中实现最先进的性能。

提出的方法

  • 将自动照片调整建模为回归问题,使用深度神经网络(DNN)学习从输入图像到增强图像的非线性映射。
  • 为每个像素设计多级特征描述符:局部像素统计、来自语义分割(场景解析和目标检测)的上下文特征,以及全局图像统计。
  • 将组合后的特征描述符作为输入,输入至深度全连接神经网络,以预测空间可变的颜色与色调调整。
  • 在图像对(原始图像与增强图像)上端到端训练DNN,以最小化预测结果与真实增强图像之间的L2损失。
  • 利用深度学习的通用近似能力,建模复杂、非线性和内容依赖的调整,这些调整难以通过传统方法捕捉。
  • 集成场景解析与目标检测,生成上下文描述符,使模型能够根据语义区域(例如,对人物的增强程度高于天空)自适应调整。

实验结果

研究问题

  • RQ1深度神经网络能否有效从图像范例中学习复杂且空间可变的照片增强风格?
  • RQ2深度学习模型能否融入语义意识,基于内容对图像不同区域应用不同的调整?
  • RQ3与简单的特征表示相比,使用多级特征描述符(局部、上下文、全局)是否能提升自动照片增强的质量?
  • RQ4所提出的方法能否在视觉效果上优于先前的自动增强技术,特别是在捕捉细微艺术化调整方面?
  • RQ5与人工增强及先前自动化方法相比,该模型在用户研究中的表现如何?

主要发现

  • 在用户研究中,所提方法显著优于先前工作,配对t检验显示p值约为10^-10,表明在感知质量与真实值相似度方面具有统计显著性。
  • 该模型成功捕捉了复杂且语义感知的调整——例如,对人物的增强程度高于背景——展示了其建模内容依赖性增强的能力。
  • 在定量评估中,该方法在MIT-Adobe FiveK数据集上的L2距离为17.40,远低于失败案例的38.63,表明其平均鲁棒性较强,尽管存在异常值。
  • 用户投票结果显示,由本方法增强的图像在评分上始终高于[Hwang et al. (2012)]的结果,证实了其更优的感知质量。
  • 该方法在多种艺术效果(包括交叉处理和前景突出)中表现出强大的泛化能力,其结果在视觉上与专业摄影师创作的作品无法区分。
  • 当语义解析不准确时(例如,将“海洋”错误标记为“山脉”)观察到失败案例,突显了性能对准确场景理解的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。