Skip to main content
QUICK REVIEW

[论文解读] Class-agnostic Reconstruction of Dynamic Objects from Videos

Zhongzheng Ren, Xiaoming Zhao|arXiv (Cornell University)|Dec 3, 2021
Advanced Vision and Imaging被引用 6
一句话总结

REDO 是一种无类别依赖的 4D 重建框架,能够从 RGBD 视频或标定视频中重建动态物体的完整、时间一致的形状,即使在遮挡或相机视角有限导致部分可见的情况下也能实现。它利用像素对齐的 4D 隐式函数和 4D 变换模块,聚合时间视觉线索并建模复杂动态,其在合成数据集和真实世界基准上的表现显著优于当前最先进方法。

ABSTRACT

We introduce REDO, a class-agnostic framework to REconstruct the Dynamic Objects from RGBD or calibrated videos. Compared to prior work, our problem setting is more realistic yet more challenging for three reasons: 1) due to occlusion or camera settings an object of interest may never be entirely visible, but we aim to reconstruct the complete shape; 2) we aim to handle different object dynamics including rigid motion, non-rigid motion, and articulation; 3) we aim to reconstruct different categories of objects with one unified framework. To address these challenges, we develop two novel modules. First, we introduce a canonical 4D implicit function which is pixel-aligned with aggregated temporal visual cues. Second, we develop a 4D transformation module which captures object dynamics to support temporal propagation and aggregation. We study the efficacy of REDO in extensive experiments on synthetic RGBD video datasets SAIL-VOS 3D and DeformingThings4D++, and on real-world video data 3DPW. We find REDO outperforms state-of-the-art dynamic reconstruction methods by a margin. In ablation studies we validate each developed component.

研究动机与目标

  • 解决从因遮挡或相机视角受限而导致物体部分可见的视频中重建动态物体完整 4D 形状的挑战。
  • 开发一个统一框架,能够处理包括刚性运动、非刚性形变和关节运动在内的多样化物体动态,且无需依赖类别特定先验知识。
  • 实现无类别依赖的重建,使模型在未见物体类别上具备泛化能力,无需微调。
  • 通过在规范 4D 空间中聚合时间维度上的视觉线索,确保时间一致性与几何精度。

提出的方法

  • 提出一种与视觉输入像素对齐的规范 4D 隐式函数,通过聚合多帧的时间线索实现完整物体形状的重建。
  • 采用 4D 变换模块来建模物体动态,实现时间维度上的特征传播与聚合。
  • 使用像素对齐的特征表示 (x_p, z_p),确保 3D 预测与 2D 视觉观测精确对齐,提升对部分可见情况的鲁棒性。
  • 应用可微分的时间聚合器 (f_agg),通过基于 Transformer 的机制融合多帧特征,增强形状重建效果。
  • 在训练过程中使用形状重建损失 (L_shape) 和时间一致性损失 (L_temp) 对网络进行监督。
  • 通过端到端可微分组件进行训练,支持零样本泛化,使模型在未见物体类别上无需微调即可进行推理。

实验结果

研究问题

  • RQ1单一统一框架能否从非约束视频中重建多样动态物体的完整 4D 形状,且在部分可见条件下表现良好?
  • RQ2如何使 4D 隐式表示与 2D 视觉输入实现像素对齐,以提升几何对齐度与重建精度?
  • RQ3无类别依赖模型在未见物体类别上的泛化能力有多强,是否无需微调即可保持良好性能?
  • RQ44D 变换模块在建模复杂动态(如刚性运动、非刚性形变和关节运动)方面的有效性如何?
  • RQ5在遮挡等挑战性条件下,像素对齐与时间聚合对重建质量的贡献有多大?

主要发现

  • 在 SAIL-VOS 3D 上,REDO 达到 38.5 mIoU、0.479 mCham. 和 1.07 mACD,相比 OFlow 提升 +5.9 mIoU、-0.085 mCham. 和 -0.22 mACD。
  • 在 DeformingThings4D++ 上,REDO 相比 OFlow 提升 +2.2 mIoU、-0.063 mCham. 和 -0.047 mACD。
  • 在真实世界 3DPW 数据集上,REDO 相比 OFlow 提升 +10.1 mIoU、-0.124 mCham. 和 -0.061 mACD,展现出强大的泛化能力。
  • 在未见类别(如狗、大猩猩、美洲豹)上的零样本评估中,REDO 保持强劲性能,未出现灾难性失败,证实其泛化能力。
  • 消融实验表明,移除像素对齐会使 mIoU 下降 7.8 分,移除时间损失会使 mACD 增加 1.65,验证了两者的必要性。
  • 定性结果表明,REDO 能成功重建被遮挡部分(如后轮、腿部),并捕捉大范围运动,但对精细细节(如手部运动)的重建精度相对较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。