Skip to main content
QUICK REVIEW

[论文解读] Learning to Synthesize a 4D RGBD Light Field from a Single Image

Pratul P. Srinivasan, Tongzhou Wang|arXiv (Cornell University)|Aug 10, 2017
Advanced Vision and Imaging参考文献 26被引用 15
一句话总结

本论文提出了一种深度学习框架,通过预测光线深度、渲染朗伯光场并进行遮挡和非朗伯效应的精细化处理,从单张2D RGB图像合成4D RGBD光场。其主要贡献是一种新颖的深度一致性正则化方法,提升了无监督单图像深度估计的性能,实现了在花朵图像上达到最先进水平的高保真光场合成,并展现出对玩具和手机拍摄图像的泛化能力。

ABSTRACT

We present a machine learning algorithm that takes as input a 2D RGB image and synthesizes a 4D RGBD light field (color and depth of the scene in each ray direction). For training, we introduce the largest public light field dataset, consisting of over 3300 plenoptic camera light fields of scenes containing flowers and plants. Our synthesis pipeline consists of a convolutional neural network (CNN) that estimates scene geometry, a stage that renders a Lambertian light field using that geometry, and a second CNN that predicts occluded rays and non-Lambertian effects. Our algorithm builds on recent view synthesis methods, but is unique in predicting RGBD for each light field ray and improving unsupervised single image depth estimation by enforcing consistency of ray depths that should intersect the same scene point. Please see our supplementary video at https://youtu.be/yLCvWoQLnms

研究动机与目标

  • 实现局部光场合成——将单张照片扩展为密集的4D光场,从而为日常摄影解锁合成对焦和光圈控制功能。
  • 通过强制相同3D场景点相交的光线之间保持物理一致性,改进无监督单图像深度估计。
  • 证明深度学习能够从单张输入图像合成高质量光场,涵盖复杂遮挡和深度变化。
  • 创建并发布目前最大的公开光场数据集(3,343个场景),包含使用孔径相机捕获的花朵和植物图像,用于训练和基准测试。
  • 探索模型在原始训练领域之外的多样化场景类别(如玩具和消费级智能手机图像)上的泛化能力。

提出的方法

  • 该方法采用两阶段CNN流水线:首先,深度估计网络预测4D光场中每条光线的深度;随后,渲染阶段利用预测的几何结构生成朗伯光场近似。
  • 提出一种新颖的基于物理的深度正则化方法,强制要求应相交于同一3D场景点的光线保持一致性,从而在无真实深度监督的情况下提升深度估计精度。
  • 第二个CNN网络通过预测被遮挡的光线和非朗伯效应(如错误的镜面反射或阴影),对朗伯光场进行精细化处理,校正初始渲染中的伪影。
  • 整个网络通过最小化朗伯光场和精细化光场的重建损失,以及深度一致性正则化项,实现端到端训练。
  • 该框架在使用Lytro Illum相机捕获的全新3,343个场景的RGBD光场数据集上进行评估,支持在真实世界孔径数据上进行训练。
  • 泛化能力在第二个包含4,281个玩具场景的数据集以及iPhone 5s拍摄的图像上进行测试,表明模型对输入质量差异和场景多样性的鲁棒性。

实验结果

研究问题

  • RQ1深度学习模型能否从单张2D RGB图像高保真地合成4D RGBD光场,包括复杂遮挡和深度变化?
  • RQ2在相同3D点相交的光线上强制执行深度一致性,是否能超越现有非学习方法,显著提升无监督单图像深度估计性能?
  • RQ3在花朵和植物场景上训练的模型,能在多大程度上泛化到其他场景类别(如玩具或智能手机拍摄图像)?
  • RQ4合成的光场是否能实现逼真的摄影效果,例如从低基线输入视图实现合成虚焦模糊和对焦调整?
  • RQ5仅使用大规模真实世界光场数据集(无真实几何标注)是否可行训练出高质量的光场合成模型?

主要发现

  • 在测试集最外层视图上,该方法的平均L1误差为0.0176,优于在未用于输入的视图子集上表现的外观光流方法(0.0145)。
  • 深度预测结果与使用完整光场的最先进非学习方法相比,表现相当或更优,证明了深度一致性正则化的有效性。
  • 模型在手机图像(如iPhone 5s)上表现出良好泛化能力,生成了逼真的光线深度和光场,具有感知上令人信服的遮挡效果和深度范围。
  • 合成的光场支持高质量的摄影效果,包括将光圈从f/28增加到f/3.5以实现合成虚焦模糊,以及实现从花朵到背景的对焦调整。
  • 模型在第二个包含4,281个玩具场景的数据集上也表现出良好泛化能力,平均L1误差为0.027,与花朵数据集上的0.026误差相当,尽管由于场景多样性导致感知质量略有下降。
  • 推理效率高,仅需不到1秒即可在单张Titan X GPU上合成187×270×8×8的光场及光线深度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。