[论文解读] Temporally Coherent Full 3D Mesh Human Pose Recovery from Monocular Video
本文提出了一种新颖的端到端循环神经网络 MVIPER,用于从单目视频中实现时序一致的完整3D网格人体姿态恢复。通过引入基于物理的数据生成流程,该方法生成了具有丰富3D网格标注(包括动态衣物形变)的逼真、多样的单目动作视频,相较于基于帧的基线方法,在时序一致性和几何精度方面表现更优,显著减少了抖动现象,并提升了遮挡或复杂姿态下的恢复效果。
Advances in Deep Learning have recently made it possible to recover full 3D meshes of human poses from individual images. However, extension of this notion to videos for recovering temporally coherent poses still remains unexplored. A major challenge in this regard is the lack of appropriately annotated video data for learning the desired deep models. Existing human pose datasets only provide 2D or 3D skeleton joint annotations, whereas the datasets are also recorded in constrained environments. We first contribute a technique to synthesize monocular action videos with rich 3D annotations that are suitable for learning computational models for full mesh 3D human pose recovery. Compared to the existing methods which simply "texture-map" clothes onto the 3D human pose models, our approach incorporates Physics based realistic cloth deformations with the human body movements. The generated videos cover a large variety of human actions, poses, and visual appearances, whereas the annotations record accurate human pose dynamics and human body surface information. Our second major contribution is an end-to-end trainable Recurrent Neural Network for full pose mesh recovery from monocular video. Using the proposed video data and LSTM based recurrent structure, our network explicitly learns to model the temporal coherence in videos and imposes geometric consistency over the recovered meshes. We establish the effectiveness of the proposed model with quantitative and qualitative analysis using the proposed and benchmark datasets.
研究动机与目标
- 解决缺乏大规模、逼真且完全标注的单目视频数据集的问题,以支持完整3D网格人体姿态恢复。
- 开发一种深度学习模型,能够利用时序上下文从单视角视频中恢复时序一致的3D人体网格。
- 与基于帧的3D姿态估计方法相比,提升网格序列的几何一致性并减少时序抖动。
- 支持新应用,例如基于视频的动作迁移,实现逼真的衣物动态效果。
- 引入针对网格级姿态恢复的新型评估指标,超越传统的关节级指标。
提出的方法
- 基于物理的动画生成流程可生成包含逼真衣物-身体交互、不同姿态、光照、视角和背景的单目视频。
- 数据集包含密集的3D标注:身体形状、3D骨骼、2D投影以及完整的网格顶点序列。
- 端到端可训练的RNN结合注意力机制,按顺序处理视频帧,建模时空动态特性。
- 网络采用循环结构,并引入上下文条件模块,跨帧关注低级视觉特征。
- 训练过程中引入身体形状平滑损失,以在连续网格帧之间强制实现几何一致性。
- 模型在所提出的合成数据集以及基准数据集(如 Human3.6M 和 UCF101)上进行训练,以提升泛化能力。
实验结果
研究问题
- RQ1在合成视频数据中基于物理的衣物动态模拟是否能提升3D网格姿态恢复模型的逼真度和泛化能力?
- RQ2带有注意力机制的循环神经网络在单目视频序列中,能否有效学习时序一致性和几何一致性?
- RQ3所提出的方法在处理遮挡和复杂运动时,是否能优于基于帧的3D网格恢复方法?
- RQ4在包含姿态插值的多样化合成视频数据上进行训练,能在多大程度上提升模型对罕见或未见姿态的鲁棒性?
- RQ5与传统的关节级指标相比,网格级评估指标在评估完整网格恢复性能方面表现如何?
主要发现
- 与基于帧的方法(如 HMR)相比,所提方法在恢复的网格序列中显著减少了时序抖动,并提升了几何一致性。
- 在 Human3.6M 和 UCF101 上的定性对比显示,该方法能成功重建被遮挡的肢体(例如,左臂位于身体后方),而 HMR 因缺乏时序上下文而失败。
- 该模型在 UCF101 的“真实场景”视频中泛化良好,能准确恢复罕见姿态(如倒立),这归因于包含姿态插值的多样化训练数据。
- 训练数据中基于物理的衣物模拟显著提升了逼真度,并改善了动态衣物形变的恢复性能。
- 引入逐顶点误差指标,相较于关节级指标,能更准确地评估网格级恢复的保真度。
- 运动迁移实验表明,可将现实世界中的人体动作高保真地迁移到虚拟角色上,实现新衣物和新背景的适配,验证了该方法的实际应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。