[论文解读] DOVE: Learning Deformable 3D Objects by Watching Videos
DOVE 从单目视频中无关键点、视角或模板监督地学习可变形物体类别详细的、带纹理的、可动的 3D 模型。通过利用时间对应关系并解决由对称性引起的姿态模糊性,它实现了形状、姿态和纹理的解耦,从而在推理时仅从单张图像即可实现时序一致且可动画化的 3D 重建。
Learning deformable 3D objects from 2D images is often an ill-posed problem. Existing methods rely on explicit supervision to establish multi-view correspondences, such as template shape models and keypoint annotations, which restricts their applicability on objects "in the wild". A more natural way of establishing correspondences is by watching videos of objects moving around. In this paper, we present DOVE, a method that learns textured 3D models of deformable object categories from monocular videos available online, without keypoint, viewpoint or template shape supervision. By resolving symmetry-induced pose ambiguities and leveraging temporal correspondences in videos, the model automatically learns to factor out 3D shape, articulated pose and texture from each individual RGB frame, and is ready for single-image inference at test time. In the experiments, we show that existing methods fail to learn sensible 3D shapes without additional keypoint or template supervision, whereas our method produces temporally consistent 3D models, which can be animated and rendered from arbitrary viewpoints.
研究动机与目标
- 从未经筛选的单目视频中学习可变形 3D 物体类别,无需显式的几何监督(如关键点、视角或模板形状)。
- 通过使用视频序列建立多帧对应关系,克服从 2D 图像进行 3D 重建的病态性问题。
- 在分层 3D 模型中解耦类别级形状先验、实例特定的形变以及随时间变化的关节式姿态。
- 仅使用视频数据进行训练,即可实现从单张图像出发的准确、时序一致的 3D 重建与渲染。
- 通过用自监督视频学习替代关键点和模板监督,减少对昂贵人工标注的依赖。
提出的方法
- 使用现成的实例分割和光流模型从视频中提取 2D 掩码和对应关系,避免人工标注。
- 通过每帧仅探索两种对称假设来解决 2D 到 3D 的视角模糊性,与先前方法相比大幅减少搜索空间。
- 采用分层 3D 形状表示,将类别级形状先验、实例特定形变和时间依赖的关节式姿态分离。
- 在规范形状和纹理上施加双边对称性,以提升泛化能力和形状一致性。
- 利用视频内的实例特定对应关系以及跨视频的实例无关对应关系,学习共享的 3D 先验。
- 训练一个端到端可微模型,仅从单张图像预测带纹理的、可动的 3D 网格,并利用视频监督确保一致性。
实验结果
研究问题
- RQ13D 重建模型能否在无任何几何监督的情况下,从未结构化的视频中学习到有意义的形状与姿态解耦?
- RQ2如何利用视频中的对称性和时序一致性来在无显式关键点或模板监督的情况下解决 3D 视角模糊性?
- RQ3在视频数据中学习类别级形状先验在多大程度上能提升对未见实例的重建质量?
- RQ4与单图方法相比,基于视频的训练在 3D 形状精度和视角泛化能力方面表现如何?
- RQ5在多样化、非正式的视频上进行训练的模型,能否从单张图像生成时序一致且可动画化的 3D 网格?
主要发现
- 完整版 DOVE 模型在玩具鸟数据集上的 Chamfer 距离为 1.51 ± 0.89 cm,显著优于消融变体。
- 移除两视角模糊性解决机制后,Chamfer 距离上升至 2.52 ± 1.41 cm,表明其在姿态估计中的关键作用。
- 若省略对称性约束,Chamfer 距离上升至 2.19 ± 1.24 cm,表明对称性是形状恢复的强先验。
- 若无视频训练,Chamfer 距离上升至 2.20 ± 1.03 cm,证明视频在发现完整 360° 物体几何结构中的重要性。
- 若移除学习到的类别形状先验,Chamfer 距离上升至 3.92 ± 1.47 cm,证明共享形状归纳偏置的有益作用。
- 定性结果表明,DOVE 生成的 3D 网格具有一致性、真实感,可从任意视角进行动画与渲染,而无需关键点监督的方法则不具备此能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。