[论文解读] TöRF: Time-of-Flight Radiance Fields for Dynamic Scene View Synthesis
TöRF 提出了一种神经辐射场表示方法,通过联合优化 RGB 与原始飞行时间(ToF)相位数据,实现更优的动态场景视图合成。通过直接建模连续波 ToF 传感器测量值,而非衍生的深度图,该方法在低反射率、多路径干扰和大运动等挑战性条件下实现了更鲁棒的重建,其在定性和定量评估中均优于 NeRF 及其他动态场景基线方法。
Neural networks can represent and accurately reconstruct radiance fields for static 3D scenes (e.g., NeRF). Several works extend these to dynamic scenes captured with monocular video, with promising performance. However, the monocular setting is known to be an under-constrained problem, and so methods rely on data-driven priors for reconstructing dynamic content. We replace these priors with measurements from a time-of-flight (ToF) camera, and introduce a neural representation based on an image formation model for continuous-wave ToF cameras. Instead of working with processed depth maps, we model the raw ToF sensor measurements to improve reconstruction quality and avoid issues with low reflectance regions, multi-path interference, and a sensor's limited unambiguous depth range. We show that this approach improves robustness of dynamic scene reconstruction to erroneous calibration and large motions, and discuss the benefits and limitations of integrating RGB+ToF sensors that are now available on modern smartphones.
研究动机与目标
- 通过引入物理传感器测量值,解决单目动态新视图合成的病态问题。
- 提升在低反射率区域、多路径干扰区域以及大运动场景下的重建鲁棒性。
- 证明使用原始 ToF 相位数据(而非处理后的深度图)可带来更优的新视图合成性能。
- 通过融合 RGB+ToF 传感器数据,实现更少输入视图下的更精确、更稳定的动态场景重建。
- 探索将现代智能手机兼容的 RGB+ToF 传感器集成到神经辐射场框架中的可行性。
提出的方法
- 该方法构建了一个基于物理的神经体渲染模型,联合优化 RGB 和连续波 ToF 相位测量值。
- 采用相位表示法建模原始 ToF 传感器响应,编码调制光的相位与振幅,保留超出无模糊深度范围的信息。
- 优化过程联合最小化 RGB 图像与相位图像上的光度误差,实现场景几何与外观的端到端学习。
- 该方法使用可微分的射线步进过程,从学习到的隐式辐射场中渲染颜色与相位信号。
- 采用多尺度、多分辨率网络架构,以高保真度高效表示动态场景。
- 该方法在手持设备捕获的 RGB+ToF 序列上进行端到端训练,支持从少量视图中实现重建。
实验结果
研究问题
- RQ1与衍生的深度图相比,原始飞行时间相位测量是否能提升动态场景的新视图合成质量?
- RQ2整合物理 ToF 传感器数据在多路径干扰、低反射率和大运动场景下如何提升重建鲁棒性?
- RQ3对 RGB 与 ToF 数据进行联合优化,能在多大程度上减少高质量新视图合成所需的输入视图数量?
- RQ4在具有挑战性的条件下,该方法与 NeRF 及现有动态场景基线相比性能如何?
- RQ5使用现代智能手机集成的 RGB+ToF 传感器在神经场景重建中的实际优势与局限性是什么?
主要发现
- TöRF 在少量视图的静态场景中,相比 NeRF 实现了更优的新视图合成质量,尤其在复杂几何结构与动态运动区域表现更佳。
- 该方法在定量指标与视觉质量上均显著优于两项最先进的动态场景基线方法 [52, 26],尤其在处理黑暗或低反射率区域时优势明显。
- 使用原始 ToF 相位数据而非处理后的深度图,可实现更精确的重建,尤其在多路径干扰区域及无模糊深度范围之外的区域。
- TöRF 展现出对相机标定误差和大运动的更强鲁棒性,而这些因素通常会显著降低单目动态 NVS 的性能。
- 该方法可在更少输入视图下实现高保真度重建,从而减轻动态场景采集的数据获取负担。
- 尽管性能有所提升,但在极端角度下对非常暗、动态的物体(如头发)的重建仍存在挑战,表明当前神经模型在极端运动与反射率条件下的能力仍有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。