Skip to main content
QUICK REVIEW

[论文解读] Learning a Discriminative Model for the Perception of Realism in Composite Images

Jun-Yan Zhu, Philipp Krähenbühl|arXiv (Cornell University)|Oct 2, 2015
Advanced Vision and Imaging参考文献 33被引用 14
一句话总结

本文提出一种基于CNN的判别模型,通过仅使用无标注数据,学习区分自然照片与自动生成的合成图像,从而预测合成图像的视觉真实感。该模型通过捕捉颜色、光照和纹理的一致性来表征真实感,在人类感知实验中优于先前方法,能够通过引导自动色彩调整和对象选择来提升合成效果。

ABSTRACT

What makes an image appear realistic? In this work, we are answering this question from a data-driven perspective by learning the perception of visual realism directly from large amounts of data. In particular, we train a Convolutional Neural Network (CNN) model that distinguishes natural photographs from automatically generated composite images. The model learns to predict visual realism of a scene in terms of color, lighting and texture compatibility, without any human annotations pertaining to it. Our model outperforms previous works that rely on hand-crafted heuristics, for the task of classifying realistic vs. unrealistic photos. Furthermore, we apply our learned model to compute optimal parameters of a compositing method, to maximize the visual realism score predicted by our CNN model. We demonstrate its advantage against existing methods via a human perception study.

研究动机与目标

  • 开发一种无需人工标注的数据驱动方法,用于评估合成图像的视觉真实感。
  • 直接从大规模无标注合成图像中学习视觉真实感线索(如颜色、光照、纹理一致性)。
  • 将学习到的模型应用于优化合成参数,实现真实感的自动提升。
  • 通过人类感知实验评估模型的有效性,与现有方法进行对比。

提出的方法

  • 使用大规模物体替换合成图像数据集,训练深层CNN以区分自然图像与自动生成的合成图像。
  • 将训练好的模型用作新图像的真实感评分预测器,按感知真实感对合成图像进行排序。
  • 通过最大化预测真实感得分来优化色彩映射函数,同时引入正则化以避免不自然的色彩偏移。
  • 通过使用新生成的性能较差的合成图像重新训练CNN,实施困难负样本挖掘,以提升模型鲁棒性。
  • 利用该模型通过排序候选合成图像,从数据库中选择最真实的前景对象。
  • 通过成对人类比较实验,采用Thurstone的Case V模型评估结果的可靠性。

实验结果

研究问题

  • RQ1在无标注合成图像上进行训练的CNN能否学习预测人类对视觉真实感的感知?
  • RQ2该模型学习到了哪些视觉线索(例如颜色、光照、纹理)与真实感相关联?
  • RQ3学习到的真实感评分能否有效指导自动色彩调整,以生成更真实的合成图像?
  • RQ4与基于形状或随机选择的方法相比,该模型在对象选择方面是否表现更优?
  • RQ5在人类感知实验中,该模型的性能与现有最先进合成方法相比如何?

主要发现

  • 该模型在合成改进方面的人类评分达到0.311,显著优于[15]的-0.247和[33]的-0.237。
  • 经过三次困难负样本挖掘迭代后,模型的真实感得分从-0.162提升至0.117,有效减少了极端色彩调整。
  • RealismCNN方法在对象选择方面的人类评分为0.285,优于基于形状的选择方法(-0.033)和随机选择方法(-0.252)。
  • 该模型成功按感知真实感对合成图像进行排序,位于决策边界附近的图像被大多数人类受试者判断为真实。
  • 该模型主要捕捉低层次的真实感线索,如颜色、光照和纹理一致性,但未建模高层次的场景语义或布局。
  • 该方法展现出良好的泛化能力,在多种图像类别和真实世界背景上均能提升合成效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。