Skip to main content
QUICK REVIEW

[论文解读] FlowCam: Training Generalizable 3D Radiance Fields without Camera Poses via Pixel-Aligned Scene Flow

Cameron M. Smith, Yilun Du|arXiv (Cornell University)|May 31, 2023
Advanced Vision and Imaging被引用 5
一句话总结

FlowCam 通过可微分渲染将 2D 光流提升至 3D 场景光流,并通过加权最小二乘法拟合估计 SE(3) 相机位姿,实现了从无姿态视频中端到端、自监督训练通用 3D 辐射场。该方法在包括野外视频在内的多样化真实世界数据集上实现了鲁棒的新视角合成与精确的相机位姿估计,且无需真实位姿或深度图。

ABSTRACT

Reconstruction of 3D neural fields from posed images has emerged as a promising method for self-supervised representation learning. The key challenge preventing the deployment of these 3D scene learners on large-scale video data is their dependence on precise camera poses from structure-from-motion, which is prohibitively expensive to run at scale. We propose a method that jointly reconstructs camera poses and 3D neural scene representations online and in a single forward pass. We estimate poses by first lifting frame-to-frame optical flow to 3D scene flow via differentiable rendering, preserving locality and shift-equivariance of the image processing backbone. SE(3) camera pose estimation is then performed via a weighted least-squares fit to the scene flow field. This formulation enables us to jointly supervise pose estimation and a generalizable neural scene representation via re-rendering the input video, and thus, train end-to-end and fully self-supervised on real-world video datasets. We demonstrate that our method performs robustly on diverse, real-world video, notably on sequences traditionally challenging to optimization-based pose estimation techniques.

研究动机与目标

  • 在无需真实相机位姿的情况下,通过仅利用视频和可微分渲染,实现从非整理视频中自监督训练通用 3D 神经场景表征。
  • 通过用端到端可微分优化替代位姿依赖性,克服结构从运动(SfM)的可扩展性瓶颈。
  • 通过可微分渲染和鲁棒位姿拟合,在一次前向传播中联合估计相机轨迹和 3D 场景几何。
  • 实现出分布式场景的零样本泛化相机位姿估计,包括 SLAM 失败的挑战性序列。
  • 在具有动态内容和失真的野外视频上,实现前馈式的新视角合成与相机位姿估计。

提出的方法

  • 通过可微分渲染将帧间 2D 光流提升为 3D 场景光流,保持空间局部性和平移等变性。
  • 通过应用于 3D 场景光流场的加权最小二乘求解器估计 SE(3) 相机位姿,权重来源于光流置信度。
  • 在位姿估计与 3D 重建之间共享神经场景表征权重,实现联合优化。
  • 使用重渲染损失作为唯一监督信号,实现在真实视频上的完全自监督训练。
  • 在推理时进行微调,以减少位姿漂移并提升几何细节,即使在无真实监督的情况下亦可实现。
  • 引入光流置信度加权机制,降低遮挡、镜面反射或动态物体带来的不可靠对应关系的影响。

实验结果

研究问题

  • RQ1能否仅通过视频和可微分渲染,在无需任何真实相机位姿的情况下训练 3D 辐射场?
  • RQ2像素对齐的 3D 场景光流能否以可微分、端到端的方式估计准确且鲁棒的相机轨迹?
  • RQ3能否通过一次前向传播同时重建 3D 场景并估计相机位姿,且对分布外序列具有强泛化能力?
  • RQ4该方法在具有动态内容和失真的真实世界野外视频上的表现如何?
  • RQ5该模型能否在无需微调或预计算的 SfM 位姿的情况下,实现与基线方法相当的新视角合成与位姿估计性能?

主要发现

  • 在 CO3D Hydrant 数据集上,完整 FlowCam 模型达到 21.02 dB PSNR 和 0.38 LPIPS,优于无光流权重或直接位姿预测的消融实验。
  • 在 Walking Tours 和 Ego4D 数据集上,经过 20–1.5 小时的推理时微调后,FlowCam 分别实现 ATE 0.013 和 0.026。
  • 该模型可零样本泛化至 ORB-SLAM3 失败的序列,证明其对高旋转和特征稀疏轨迹的鲁棒性。
  • 光流置信度加权机制有效降低了不可靠光流对应关系的影响,提升了对遮挡和动态物体的鲁棒性。
  • 经过 7 小时的推理时优化,FlowCam 生成的几何结构漂移极小,且新视角合成结果视觉上极具说服力。
  • 消融研究证实,基于光流的位姿建模至关重要;直接使用 CNN 的位姿预测或非加权的 Procrustes 拟合会导致几何退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。