[论文解读] S$^3$-NeRF: Neural Reflectance Field from Shading and Shadow under a Single Viewpoint
S$^3$-NeRF 提出了一种新颖的神经反射率场方法,能够从单视角图像在变化点光源条件下重建完整的三维场景几何结构——包括可见和不可见表面。通过利用可微分体素渲染和在线阴影计算,联合优化几何与BRDF,借助明暗和阴影线索,实现了鲁棒且高保真的重建,支持新视角合成与光照重演,即使在未校准光源位置和光源数量有限的情况下亦能实现。
In this paper, we address the "dual problem" of multi-view scene reconstruction in which we utilize single-view images captured under different point lights to learn a neural scene representation. Different from existing single-view methods which can only recover a 2.5D scene representation (i.e., a normal / depth map for the visible surface), our method learns a neural reflectance field to represent the 3D geometry and BRDFs of a scene. Instead of relying on multi-view photo-consistency, our method exploits two information-rich monocular cues, namely shading and shadow, to infer scene geometry. Experiments on multiple challenging datasets show that our method is capable of recovering 3D geometry, including both visible and invisible parts, of a scene from single-view images. Thanks to the neural reflectance field representation, our method is robust to depth discontinuities. It supports applications like novel-view synthesis and relighting. Our code and model can be found at https://ywq.github.io/s3nerf.
研究动机与目标
- 解决单视角方法仅能恢复2.5D表示(如深度图或法线图)的局限性,后者无法建模遮挡或背向表面。
- 仅使用单一视角和多个点光源,实现完整3D场景重建——包括不可见部分。
- 开发一种神经反射率场,通过利用单目明暗和阴影线索,联合优化几何与BRDF,而非依赖多视角图像一致性。
- 通过学习连续的3D场景表示,支持下游应用如新视角合成与光照重演。
提出的方法
- 该方法构建一种神经反射率场,将3D坐标映射到场景属性(几何、BRDF和颜色),采用基于坐标的MLP实现隐式3D表示。
- 利用可微分体素渲染计算从3D射线生成的像素颜色,结合基于物理的渲染、方向光源和BRDF模型。
- 通过从3D点到光源的光线追踪集成阴影计算,将优化限制在预期表面点上,以实现高效的在线阴影评估。
- 通过自校准的光度立体网络(SDPS-Net)进行初始化,联合优化光源位置和方向,即使在真实世界未校准的图像捕获下也能实现。
- 采用多损失目标函数,结合光度重建损失、法线一致性损失和深度正则化项,以提升几何与反射率的准确性。
- 该方法在变化点光源的单视角图像上端到端训练,能够重建非朗伯材质和深度不连续区域。
实验结果
研究问题
- RQ1能否有效利用单视角下多个点光源的明暗和阴影线索,重建完整的3D几何结构,包括遮挡和不可见表面?
- RQ2神经反射率场能否在不依赖多视角图像一致性的情况下,仅从单目光度图像联合恢复几何与BRDF?
- RQ3该方法在真实世界捕获设置中,对光源数量和空间分布变化的鲁棒性如何?
- RQ4尽管仅从单一视角训练,该方法在多视角合成与光照重演方面能实现到何种程度?
- RQ5与现有单视角或多视角方法相比,该方法在复杂材质和存在深度不连续性的场景中表现如何?
主要发现
- 在64个点光源下,S$^3$-NeRF在CHAIR数据集上的平均绝对误差(MAE)为1.81,在ARMADILLO数据集上为1.88,深度误差低于9.0 mm,PSNR高于40.0,表明重建保真度极高。
- 即使仅使用8个光源,该方法仍保持强劲性能,在CHAIR上MAE为2.33,在ARMADILLO上为2.51,证明其对低光源数量的鲁棒性。
- 随着光源数量增加,性能持续提升:MAE从4个光源时的30.39降至128个光源时的1.81,表明更多光源输入可更精细地优化表面几何。
- 该方法成功利用阴影线索重建不可见区域,即使光源分布范围小或广,性能保持一致,表现稳定。
- 在使用未校准的闪光灯进行真实世界捕获时,该方法生成了视觉上合理的法线图和3D重建结果,验证了其无需人工光源校准的实用性。
- 该模型支持高质量的新视角合成与光照重演,证明了所学习的神经反射率场在重建之外的实用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。