Skip to main content
QUICK REVIEW

[论文解读] InverseRenderNet: Learning single image inverse rendering

Ye Yu, William A. P. Smith|arXiv (Cornell University)|Nov 29, 2018
Advanced Vision and Imaging参考文献 45被引用 8
一句话总结

InverseRenderNet 是首个利用自监督方法,从真实、非受控的户外图像中,通过单张图像进行逆向渲染的深度学习方法——估计反照率、法线图和球谐照明。通过利用多视角立体(MVS)重建进行几何监督,并结合统计光照先验,该方法在法线估计方面达到最先进性能,在无真实标签的情况下实现具有竞争力的反照率预测,从而实现仅凭单张图像即可进行逼真的光照重演。

ABSTRACT

We show how to train a fully convolutional neural network to perform inverse rendering from a single, uncontrolled image. The network takes an RGB image as input, regresses albedo and normal maps from which we compute lighting coefficients. Our network is trained using large uncontrolled image collections without ground truth. By incorporating a differentiable renderer, our network can learn from self-supervision. Since the problem is ill-posed we introduce additional supervision: 1. We learn a statistical natural illumination prior, 2. Our key insight is to perform offline multiview stereo (MVS) on images containing rich illumination variation. From the MVS pose and depth maps, we can cross project between overlapping views such that Siamese training can be used to ensure consistent estimation of photometric invariants. MVS depth also provides direct coarse supervision for normal map estimation. We believe this is the first attempt to use MVS supervision for learning inverse rendering.

研究动机与目标

  • 解决在无真实标签的非受控户外场景中,单图逆向渲染的病态问题。
  • 通过自监督方法,实现从真实世界图像中端到端学习反照率、法线图和光照。
  • 引入多视角立体(MVS)重建作为几何监督来源,以克服单图估计中的模糊性。
  • 开发自然球谐照明的统计先验,以正则化学习过程。
  • 展示首个无需合成数据或微调即可泛化至复杂真实场景的端到端逆向渲染系统。

提出的方法

  • 一个全卷积神经网络将单张 RGB 图像作为输入,回归出漫反射反照率和法线图。
  • 网络从估计的反照率和法线图中计算最小二乘最优球谐照明系数。
  • 通过可微分渲染器实现自监督:从预测的反照率、法线和光照重建输入图像,并使用光度损失进行优化。
  • 在离线阶段对大规模图像集合应用多视角立体(MVS),以恢复深度和姿态,从而在重叠视图之间实现光度不变量的交叉投影,支持孪生网络训练。
  • MVS 深度图为法线图估计提供粗略监督,提升几何一致性。
  • 从真实世界的球谐系数中学习自然光照的统计先验,以正则化光照预测。

实验结果

研究问题

  • RQ1深度神经网络能否在无任何真实标签的情况下,仅从一张非受控的真实图像中学习执行逆向渲染?
  • RQ2多视角立体重建能否为单图逆向渲染提供有效的几何监督?
  • RQ3能否利用多视角之间的光度不变量,通过孪生网络训练强制反照率和法线估计的一致性?
  • RQ4引入自然光照的统计先验是否能提升逆向渲染结果的真实感与准确性?
  • RQ5所得到的网络能否从单张图像生成稳定且逼真的光照重演结果?

主要发现

  • 在 MegaDepth 基准上,该网络在法线图估计方面表现最佳,平均角度误差为 37.7°,中位数为 34.8°。
  • 在未在 IIW 数据集上微调的方法中,其反照率预测的 DSSIM 为 0.201,MSE 为 0.0170,排名第二。
  • 该网络可使用新颖的光照条件生成逼真的光照重演结果,证明了其逆向渲染输出的稳定性和真实感。
  • MVS 监督的使用显著提升了法线图估计性能,如与无此监督的基线方法相比的性能提升所示。
  • 统计光照先验有助于生成更真实的光照估计,其一致性在光照重演结果中得到验证。
  • 该方法在复杂真实场景中表现出良好的泛化能力,标志着首个无需合成数据或微调即可在非受控户外环境中成功运行的端到端逆向渲染系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。