Skip to main content
QUICK REVIEW

[论文解读] 2D Image Relighting with Image-to-Image Translation

Paul Gafton, Erick Maraz|ArXiv.org|Jun 14, 2020
Generative Adversarial Networks and Image Synthesis参考文献 19被引用 9
一句话总结

本文提出一种基于 GAN 的图像到图像翻译方法,用于在 2D 图像上实现光照重布光,采用 pix2pix 框架,在 VIDIT 数据集上进行训练,可将任意输入光照方向转换为八个预设位置之一(N、NE、E 等)。该方法在无需几何先验的情况下实现了合理的阴影与光照一致性,PSNR 值在目标方向之间介于 20.56 dB 至 22.24 dB 之间。

ABSTRACT

With the advent of Generative Adversarial Networks (GANs), a finer level of control in manipulating various features of an image has become possible. One example of such fine manipulation is changing the position of the light source in a scene. This is fundamentally an ill-posed problem, since it requires understanding the scene geometry to generate proper lighting effects. This problem is not a trivial one and can become even more complicated if we want to change the direction of the light source from any direction to a specific one. Here we provide our attempt to solve this problem using GANs. Specifically, pix2pix [arXiv:1611.07004] trained with the dataset VIDIT [arXiv:2005.05460] which contains images of the same scene with different types of light temperature and 8 different light source positions (N, NE, E, SE, S, SW, W, NW). The results are 8 neural networks trained to be able to change the direction of the light source from any direction to one of the 8 previously mentioned. Additionally, we provide, as a tool, a simple CNN trained to identify the direction of the light source in an image.

研究动机与目标

  • 通过改变光源方向,实现无需几何先验或深度图的 2D 图像自动化、可控重布光。
  • 通过利用 GAN 从合成数据中学习逼真的光照过渡,解决重布光问题的病态性。
  • 开发一种在多样化场景中具有良好泛化能力的系统,同时保持全局图像一致性和阴影结构。
  • 评估端到端图像到图像翻译在重布光中的可行性,避免复杂的 3D 重建流程。
  • 为艺术家和摄影师提供一种轻量化、可训练的工具,以在后期处理中高效探索光照变化。

提出的方法

  • 训练了八个独立的 pix2pix GAN 模型,每个模型专门用于将任意输入方向的光照转换为八个目标方向之一(N、NE、E、SE、S、SW、W、NW)。
  • 使用合成的 VIDIT 数据集,该数据集提供同一场景在八个光源位置和五个色温下的图像,并提供光照一致性的真实标签。
  • 将图像预处理为 pix2pix 所需的成对输入-输出格式,重布光实验中使用恒定的 4500K 色温。
  • 采用标准的 pix2pix 训练方式,包括对抗损失、L1 重建损失和批量归一化,使用默认超参数以获得最佳性能。
  • 训练了一个独立的 8 类 CNN 分类器,用于从输入图像中预测光照方向,使用 Adam 优化器和可变的初始学习率。
  • 通过损失曲线和可视化样本监控训练过程,以选择最优超参数并评估模型收敛性。

实验结果

研究问题

  • RQ1在无几何先验的情况下,基于 GAN 的图像到图像翻译能否有效解决 2D 图像重布光的病态问题?
  • RQ2基于 GAN 的模型在多样化场景中进行光照方向转移时,其在保持阴影结构和全局一致性方面的泛化能力如何?
  • RQ3有限的阴影信息和缺乏间接光照对生成重布光图像的质量有何影响?
  • RQ4轻量级 CNN 分类器在多大程度上能准确从单张图像中预测光照方向,其对方向模糊性的鲁棒性如何?
  • RQ5纯图像基方法在视觉真实感和方向准确性方面,能否优于或匹配基于 3D 先验的方法?

主要发现

  • 重布光网络的 PSNR 值在 20.56 dB(W 目标)至 22.24 dB(S 目标)之间,表明重建保真度中等至较高。
  • 强方向性光照下的阴影投射通常准确,但暗部或复杂阴影因细节不足且缺乏间接光照而恢复效果较差。
  • 具有大量直线的合成场景中出现伪影,表明在变换下保持几何一致性存在挑战。
  • 光照方向分类器在 45 度范围内的准确率为 65%,在 90 度范围内的准确率为 97%,表明其具有较强的定向泛化能力。
  • 训练过程显示逐步改进,约在 500–750 个周期后出现明显收敛,但完整训练(1000 个周期)方能获得最佳结果。
  • 用单目深度估计替代几何先验导致出现“肥皂膜”伪影且阴影质量差,凸显了当前深度估计在侧视场景中的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。