Skip to main content
QUICK REVIEW

[论文解读] NeuPhysics: Editable Neural Geometry and Physics from Monocular Videos

Yi-Ling Qiao, Alexander Gao|arXiv (Cornell University)|Oct 22, 2022
Model Reduction and Neural Networks被引用 8
一句话总结

NeuPhysics 提出了一种方法,通过解耦的神经场表示从单目视频重建可编辑的 3D 几何与物理特性:使用时间不变的符号距离函数(SDF)表示静态几何,以及时间条件的形变场表示运动。通过在神经场与六面体网格之间实现双向转换,该方法支持交互式编辑与可微分物理模拟,利用循环一致性损失实现端到端优化,在网格与视频重建方面达到最先进性能。

ABSTRACT

We present a method for learning 3D geometry and physics parameters of a dynamic scene from only a monocular RGB video input. To decouple the learning of underlying scene geometry from dynamic motion, we represent the scene as a time-invariant signed distance function (SDF) which serves as a reference frame, along with a time-conditioned deformation field. We further bridge this neural geometry representation with a differentiable physics simulator by designing a two-way conversion between the neural field and its corresponding hexahedral mesh, enabling us to estimate physics parameters from the source video by minimizing a cycle consistency loss. Our method also allows a user to interactively edit 3D objects from the source video by modifying the recovered hexahedral mesh, and propagating the operation back to the neural field representation. Experiments show that our method achieves superior mesh and video reconstruction of dynamic scenes compared to competing Neural Field approaches, and we provide extensive examples which demonstrate its ability to extract useful 3D representations from videos captured with consumer-grade cameras.

研究动机与目标

  • 实现从单个单目 RGB 视频端到端学习 3D 几何与物理参数。
  • 通过将静态几何与动态运动解耦,解决单目 3D 重建的欠约束问题。
  • 通过双向网格-场转换流程,弥合神经隐式表示与可微分物理模拟之间的鸿沟。
  • 通过修改显式的六面体网格并将更改回传至神经场,支持对 3D 场景的交互式编辑。
  • 通过联合优化几何与物理从视频输入,消除对手动 3D 模型初始化的依赖。

提出的方法

  • 场景表示为时间不变的符号距离函数(SDF)以表示几何,同时结合独立的神经场表示外观、刚性与时间条件的运动位移。
  • 通过时间条件的形变场建模运动,将某一帧中的 3D 坐标映射回其参考帧位置,实现在时间维度上的逐点对应。
  • 建立隐式神经场与显式六面体网格之间的双向转换,使用户能够编辑网格并将更改传播至神经场。
  • 通过最小化可微分物理模拟器与运动场之间的循环一致性损失来优化物理参数,确保模拟与观测动态的一致性。
  • 利用刚性图将动态前景物体与背景分离,必要时可使用用户定义的包围盒进一步提升前景提取效果。
  • 框架整合了可微分渲染(NeuS)与物理模拟(可微分引擎),支持几何、外观与动力学的联合优化,实现端到端训练。

实验结果

研究问题

  • RQ1仅使用单目视频是否能够恢复完整、可编辑的 3D 场景,且具备精确的几何与物理上合理的动态特性?
  • RQ2如何有效将神经场解耦为静态几何与动态运动,以提升重建的稳定性和质量?
  • RQ3在无需手动 3D 模型初始化的前提下,可微分物理模拟与神经隐式表示的集成程度如何?
  • RQ4双向网格-场转换流程是否能够通过显式网格操作实现对神经场的交互式编辑?
  • RQ5基于循环一致性的物理优化与直接的 Chamfer 距离最小化相比,在速度与精度方面表现如何?

主要发现

  • 所提出的循环一致性损失将总优化时间从约 115 秒(使用 Chamfer 距离)减少至约 67 秒,同时保持相当的重建与模拟质量。
  • 与竞争的神经场方法相比,该方法在定量与定性层面均实现了更优的网格与视频重建质量。
  • 当阈值设为 0.2 时,刚性图可实现鲁棒的前景-背景分离,用户定义的包围盒在需要时可进一步提升分割效果。
  • 仅靠运动幅度不足以用于动态物体检测,因为循环运动中位移较小,因此刚性图作为更可靠的判别标准。
  • 双向网格-场转换支持对 3D 场景的直接操作,如添加、删除或形变物体,同时保持一致的神经场表示。
  • 该框架成功实现了从原始单目视频进行基于物理的动画与模拟,展示了其在数字孪生与交互式 3D 内容创作方面的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。