[论文解读] DIST: Rendering Deep Implicit Signed Distance Function with Differentiable Sphere Tracing
本文提出 DIST,一种用于深度隐式符号距离函数(SDF)的可微分球体追踪渲染器,其表示形式为神经网络。通过优化前向和反向传播,该方法实现了高效、内存高效的 3D 形状重建,仅需 2D 观测数据(如多视角图像或深度图),且无需微调即可实现最先进的泛化能力和鲁棒性。
We propose a differentiable sphere tracing algorithm to bridge the gap between inverse graphics methods and the recently proposed deep learning based implicit signed distance function. Due to the nature of the implicit function, the rendering process requires tremendous function queries, which is particularly problematic when the function is represented as a neural network. We optimize both the forward and backward passes of our rendering layer to make it run efficiently with affordable memory consumption on a commodity graphics card. Our rendering method is fully differentiable such that losses can be directly computed on the rendered 2D observations, and the gradients can be propagated backwards to optimize the 3D geometry. We show that our rendering method can effectively reconstruct accurate 3D shapes from various inputs, such as sparse depth and multi-view images, through inverse optimization. With the geometry based reasoning, our 3D shape prediction methods show excellent generalization capability and robustness against various noises.
研究动机与目标
- 通过实现可微分渲染,弥合逆图形与基于深度学习的隐式 SDF 表示之间的差距。
- 解决连续 SDF 可微分渲染中的计算与内存挑战,后者在射线步进过程中需要大量函数查询。
- 通过在学习的潜在空间中进行几何推理,实现从稀疏或部分 2D 观测(如深度图、多视角图像)中准确重建 3D 形状。
- 相比先前的基于学习或基于网格的方法,提升对噪声、域偏移和不良初始化的泛化能力和鲁棒性。
提出的方法
- 采用球体追踪作为核心渲染算法,从每个像素开始沿射线行进,直到符号距离值达到零(表面命中)。
- 在前向传播中引入从粗到精的射线步进策略,以减少早期计算并避免冗余查询。
- 采用激进的射线步进步长,并结合安全收敛准则,在保持分辨率的同时最小化查询次数。
- 在反向传播中提出一种梯度近似方法,显著降低内存与计算开销,对训练性能影响可忽略不计。
- 将可微分渲染器与预训练的 DeepSDF 生成器集成,通过逆图形优化潜在码,使渲染结果与观测到的 2D 图像之间的损失最小化。
- 支持多种 2D 监督信号,包括深度图、表面法线、轮廓以及跨视角的光度一致性。
实验结果
研究问题
- RQ1能否在不产生过高内存或计算成本的前提下,于通用硬件上高效实现神经隐式 SDF 的可微分球体追踪?
- RQ2通过可微分渲染进行几何推理,是否能提升在不同数据集之间以及在噪声或稀疏输入下的 3D 形状重建泛化能力?
- RQ3在准确性和鲁棒性方面,可微分 SDF 渲染方法与基于网格或纯学习的方法相比表现如何?
- RQ4当初始潜在码被随机化,或相机参数偏离训练分布时,该方法的有效性在多大程度上仍能保持?
主要发现
- 所提出的可微分渲染器在 PMO 合成测试集上实现了最先进的 3D 形状重建精度,尽管未在该数据集上进行微调,其性能仍与 PMO 相当。
- 在未见的相机焦距上,该方法的泛化能力显著优于 PMO,性能下降极小,而 PMO 受到域偏移和过拟合的严重影响。
- 当使用随机潜在码或噪声初始化时,该方法仍能保持高质量的重建结果,而 PMO 在相同条件下性能急剧下降。
- 在真实世界多视角数据集上,DIST 生成的 3D 形状比 PMO 更准确且结构更正确,而 PMO 常常无法恢复细节或正确拓扑。
- 反向传播中的梯度近似方法显著降低了内存与计算开销,对训练影响可忽略,使消费者 GPU 上的高效优化成为可能。
- 该方法实现了强大的几何推理能力:即使从随机初始化出发,也能获得高质量的 3D 重建,展示了超越监督微调的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。