Skip to main content
QUICK REVIEW

[论文解读] Online Adaptation for Consistent Mesh Reconstruction in the Wild

Xueting Li, Sifei Liu|arXiv (Cornell University)|Dec 6, 2020
Advanced Vision and Imaging被引用 19
一句话总结

本文提出了一种用于从野外视频中实现可变形物体时序一致的3D网格重建的在线自适应框架,无需依赖3D标注、2D关键点或相机位姿。通过利用视频帧之间UV纹理、形状和部件对应关系的自监督时序一致性,该方法在测试时自适应过程中稳定并优化了网格预测,实现了对非刚性动物(如鸟类和斑马)从非结构化互联网视频中鲁棒的3D重建。

ABSTRACT

This paper presents an algorithm to reconstruct temporally consistent 3D meshes of deformable object instances from videos in the wild. Without requiring annotations of 3D mesh, 2D keypoints, or camera pose for each video frame, we pose video-based reconstruction as a self-supervised online adaptation problem applied to any incoming test video. We first learn a category-specific 3D reconstruction model from a collection of single-view images of the same category that jointly predicts the shape, texture, and camera pose of an image. Then, at inference time, we adapt the model to a test video over time using self-supervised regularization terms that exploit temporal consistency of an object instance to enforce that all reconstructed meshes share a common texture map, a base shape, as well as parts. We demonstrate that our algorithm recovers temporally consistent and reliable 3D structures from videos of non-rigid objects including those of animals captured in the wild -- an extremely challenging task rarely addressed before.

研究动机与目标

  • 解决从野外视频中重建非刚性可变形物体的时序一致3D网格的挑战,其中3D监督稀缺或不可用。
  • 实现在非受限真实场景中捕获的动物及其他复杂非刚性物体的鲁棒3D重建。
  • 开发一种测试时自适应策略,仅使用视频数据和自监督时序一致性来提升网格质量。
  • 通过引入尽可能刚性(ARAP)约束,消除对对称形状的假设,以实现更真实的非刚性形变。
  • 通过在单视角图像上训练类别特定模型,并在线适应到新的视频序列,实现对不同物体实例的泛化能力。

提出的方法

  • 使用弱监督(前景轮廓、部分模型的2D关键点,以及可微渲染用于RGB和形状监督)在单视角图像上训练类别特定的3D重建模型。
  • 在推理阶段,通过使用自监督正则化项的测试时训练,将模型在线适应到测试视频。
  • 通过UV纹理空间中的不变性约束强制实现时序一致性,确保所有帧共享纹理图并保持一致的部件对应关系。
  • 使基础形状在各帧间保持不变,以在自适应过程中稳定整体网格几何结构。
  • 在测试时自适应过程中应用尽可能刚性(ARAP)约束,以在不假设对称性的情况下保留真实的非刚性形变。
  • 采用滑动窗口方案按顺序处理视频帧,对短时序片段应用一致性损失,以提升稳定性和泛化能力。

实验结果

研究问题

  • RQ1UV纹理、形状和部件对应关系中的自监督时序一致性是否能改善从非结构化视频中进行3D网格重建?
  • RQ2仅使用视频数据和自监督时序一致性,是否能通过在线测试时自适应稳定并优化3D网格预测,而无需3D标注或真实相机位姿?
  • RQ3该方法是否能泛化到野外拍摄的非刚性、非对称动物(如鸟类和斑马)?
  • RQ4通过ARAP去除对称形状假设,是否能提升复杂形变下的重建质量?
  • RQ5仅使用视频级别的自监督,能否有效将仅在单视角图像上训练的模型适应到新的视频实例?

主要发现

  • 该方法实现了对非刚性动物(如鸟类和斑马)在非结构化真实世界视频中时序一致的3D网格重建,这一任务此前极少被研究。
  • UV纹理和部件对应关系中的自监督时序一致性显著稳定了网格预测,并减少了时间抖动。
  • ARAP约束使得对动物头部倾斜和肢体运动等复杂非对称形变的重建更加准确。
  • 即使仅在单视角图像上训练且无视频数据,模型也能很好地泛化到同类别中的新物体实例。
  • 失败案例主要出现在大运动、遮挡或光照变化情况下,主要原因是自监督UVC模型中的部件传播错误。
  • 与仅依赖单视角重建的基线方法相比,该方法在需要时间一致性的视频设置中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。