[论文解读] DeepLight: Learning Illumination for Unconstrained Mobile Mixed Reality
DeepLight 提出了一种深度学习方法,仅通过一张低动态范围(LDR)的手机图像,即可推断出高动态范围(HDR)的全向光照,利用三种具有不同材质的反光球体揭示光照线索。该方法在包含20万张带球体的LDR视频上进行训练,通过可微分的基于图像的再光照和对抗性损失,回归得到HDR光照,实现在移动设备上的实时推理,并在室内和室外场景中均优于先前方法的逼真度。
We present a learning-based method to infer plausible high dynamic range (HDR), omnidirectional illumination given an unconstrained, low dynamic range (LDR) image from a mobile phone camera with a limited field of view (FOV). For training data, we collect videos of various reflective spheres placed within the camera's FOV, leaving most of the background unoccluded, leveraging that materials with diverse reflectance functions reveal different lighting cues in a single exposure. We train a deep neural network to regress from the LDR background image to HDR lighting by matching the LDR ground truth sphere images to those rendered with the predicted illumination using image-based relighting, which is differentiable. Our inference runs at interactive frame rates on a mobile device, enabling realistic rendering of virtual objects into real scenes for mobile mixed reality. Training on automatically exposed and white-balanced videos, we improve the realism of rendered objects compared to the state-of-the art methods for both indoor and outdoor scenes.
研究动机与目标
- 解决从单张无约束、视场受限的低动态范围(LDR)手机图像中估计合理、全向HDR光照的挑战。
- 克服室内和室外场景中缺乏公开配对的LDR与HDR训练数据的问题。
- 实现在移动设备上实时、高保真度的光照估计,以支持逼真的混合现实合成。
- 在无需HDR全景图或推理时场景特定校准的情况下,泛化于多种光照条件。
提出的方法
- 使用三颗反光球体(镜面、漫反射灰色、金属材质)在手机摄像头视场内移动的视频收集训练数据,单次曝光即可捕获多样化的光照线索。
- 测量每颗球体的反射场,以在训练期间实现基于预测光照的精确渲染。
- 训练卷积神经网络(CNN)从LDR背景图像(排除球体区域)回归到HDR光照估计。
- 使用可微分的基于图像的再光照技术,将预测光照下的球体进行渲染,并最小化渲染图像与真实球体图像之间的L2损失。
- 引入对抗性损失以提升高频光照恢复能力,增强感知真实感。
- 在训练中利用相邻视频帧的时间一致性,隐式正则化时间稳定性,从而实现在移动CPU上的实时推理。
实验结果
研究问题
- RQ1单张嵌入反光球体的LDR手机图像是否能提供足够线索,以在多种室内和室外环境中实现准确的HDR光照估计?
- RQ2深度学习模型如何在不依赖场景特定或HDR全景图训练数据的情况下,泛化于室内和室外场景?
- RQ3与先前的监督方法相比,可微分的基于图像的再光照和对抗性训练在多大程度上提升了推断光照的真实感?
- RQ4该模型能否在保持虚拟物体合成高感知质量的同时,实现在移动硬件上的实时推理?
- RQ5在未显式校准的情况下,该方法在自动曝光和白平衡等不同相机设置下表现如何?
主要发现
- 在450个样本子集上,通过RGB相对辐射度准确度衡量,该方法在室内和室外场景的光照估计中均达到最先进性能。
- 模型无需单独训练或领域自适应,即可在室内和室外环境中实现良好泛化。
- 在移动CPU上推理速度达到12–20 fps,支持消费级智能手机上的实时混合现实应用。
- 使用不同材质的反光球体,使网络能够从单次曝光中捕获高频(如高光)和低频(如环境光照)的光照线索。
- 对抗性损失提升了对细微光照细节的恢复,相比基线方法,使虚拟物体渲染更加逼真。
- 定性结果表明,渲染的虚拟物体与同一场景中的真实3D打印和涂装物体高度匹配,证实了感知真实感的显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。