[论文解读] Neural Inverse Rendering for General Reflectance Photometric Stereo
本论文提出一个无监督、基于物理的 CNN 框架(PSNet 和 IRNet),通过对观测进行渲染并在测试场景上直接最小化重建损失,联合估计每像素表面法线和 BRDF,在真实世界数据上实现了最先进的性能,无需真实法线或预训练。
We present a novel convolutional neural network architecture for photometric stereo (Woodham, 1980), a problem of recovering 3D object surface normals from multiple images observed under varying illuminations. Despite its long history in computer vision, the problem still shows fundamental challenges for surfaces with unknown general reflectance properties (BRDFs). Leveraging deep neural networks to learn complicated reflectance models is promising, but studies in this direction are very limited due to difficulties in acquiring accurate ground truth for training and also in designing networks invariant to permutation of input images. In order to address these challenges, we propose a physics based unsupervised learning framework where surface normals and BRDFs are predicted by the network and fed into the rendering equation to synthesize observed images. The network weights are optimized during testing by minimizing reconstruction loss between observed and synthesized images. Thus, our learning process does not require ground truth normals or even pre-training on external images. Our method is shown to achieve the state-of-the-art performance on a challenging real-world scene benchmark.
研究动机与目标
- 解决未知、广义 BRDF 的光度法线估计,而不仅仅是 Lambertian 假设。
- 开发一个不依赖真实法线或外部预训练的无监督、逐场景学习框架。
- 将物理反射渲染融入到 CNN 架构中,以学习复杂 BRDF。
- 通过直接在目标数据上测试,确保置换不变性和对真实世界场景的适用性。
提出的方法
- 两子网络结构:PSNet 从在已知光照方向下连接的输入图像预测逐像素的表面法线图;IRNet 通过渲染风格的 BRDF 和阴影模型合成每个观测图像,并输出一个反射率图像。
- IRNet 输入包括一个镜面性提示通道、与 PSNet 输出的全局特征融合,以及每个照明信息,通过渲染方程 I = R ⊙ max(ℓ^T N, 0) 重建每个观测。
- 端到端训练在观测图像和合成图像之间最小化重建损失(Lrec),并在初期阶段对法线施加弱监督项(Lprior)以在复杂场景中稳定学习。
- 在 SGD 过程中直接在测试场景上进行学习(不进行预训练),在重建损失中引入随机失活以改善收敛,并将 BatchNorm 配置为对给定数据的训练统计。
- 重建损失聚焦于目标物体区域,并采用 MAE 形式以对镜面高光具有鲁棒性。
实验结果
研究问题
- RQ1无监督、逐场景学习是否在没有真实法线的情况下可恢复广义 BRDF 的准确表面法线?
- RQ2将物理渲染方程整合到 CNN 是否能实现对超越手工设计模型的广义 BRDF 的学习?
- RQ3相对于无监督或全阶段监督,早期弱监督是否能在复杂现实场景中改善收敛性和准确性?
- RQ4是否有可能在不对外部数据进行预训练的情况下,在真实基准数据集(如 DiLiGenT)上实现最先进的光度法向估计?
主要发现
- 在 DiLiGenT 真实世界基准上实现最先进的性能,在八个场景中的平均分数最好,且在多数场景上获得最佳单项分数。
- 完整架构(包括镜面输入和全局观测融合)提供最好的精度;去除镜面通道会显著降低金属样表面的性能。
- 早期阶段的弱监督稳定学习,并产生比无监督或全阶段监督更好的中位数/均值夹角误差,使在没有真实法线情况下也能有效优化。
- 以无监督方式逐场景训练,将网络权重直接拟合到测试数据,且未进行先前预训练,仍优于若干先前的学习型和经典方法。
- 将镜面提示和基于物理的渲染引入 IRNet 相较纯数据驱动方法能提高对复杂 BRDF 的学习效果。
- 该方法计算成本仍然较高(每场景数小时左右),但在处理多样材料和光照方面表现出鲁棒性与灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。