Skip to main content
QUICK REVIEW

[论文解读] Human Motion Transfer with 3D Constraints and Detail Enhancement

Yang-Tian Sun, Qiancheng Fu|arXiv (Cornell University)|Mar 30, 2020
Advanced Vision and Imaging被引用 4
一句话总结

本文提出了一种基于GAN的人体动作迁移方法,利用从重建的参数化人体模型中获得的3D约束以及细节增强网络,生成逼真且高保真的动作迁移视频。通过利用拉普拉斯特征实现3D结构一致性,并从真实源帧中迁移细微细节,该方法在定性和定量结果上均优于当前最先进方法。

ABSTRACT

We propose a new method for realistic human motion transfer using a generative adversarial network (GAN), which generates a motion video of a target character imitating actions of a source character, while maintaining high authenticity of the generated results. We tackle the problem by decoupling and recombining the posture information and appearance information of both the source and target characters. The innovation of our approach lies in the use of the projection of a reconstructed 3D human model as the condition of GAN to better maintain the structural integrity of transfer results in different poses. We further introduce a detail enhancement net to enhance the details of transfer results by exploiting the details in real source frames. Extensive experiments show that our approach yields better results both qualitatively and quantitatively than the state-of-the-art methods.

研究动机与目标

  • 为解决从源受试者到目标受试者的逼真人体动作迁移挑战,同时保持外观和动作的真实性。
  • 通过引入3D几何约束,克服姿态迁移中的伪影,特别是自遮挡和结构失真问题。
  • 通过利用真实源帧中的几何信息,增强细粒度视觉细节(尤其是手部和面部特征),提升真实感。
  • 通过整合3D身体结构与细节感知优化,提升动作迁移的时序一致性和图像质量。

提出的方法

  • 使用非刚性3D重建流程,从单目源视频和目标视频序列中重建3D参数化人体模型。
  • 从重建的3D网格中提取拉普拉斯特征,作为变形不变的内在几何表示,用于GAN条件中的3D约束。
  • 将2D姿态和投影后的拉普拉斯特征作为条件输入,送入基于GAN的图像到图像翻译网络,以保持不同姿态下的结构完整性。
  • 设计一个细节增强网络(DE-Net),将源帧几何与目标姿态对齐,并将高频细节(如手部、面部)迁移至目标,以增强真实感。
  • 联合训练动作迁移网络(MT-Net)与DE-Net,使用源帧和目标帧,实现细节感知的生成。
  • 在DE-Net中应用对齐变换,确保源与目标之间的空间对应关系,减少细节迁移中的伪影。

实验结果

研究问题

  • RQ1与仅使用2D姿态条件相比,从重建的人体模型中提取的3D几何约束是否能提升动作迁移结果的结构保真度?
  • RQ2在动作迁移任务中,使用拉普拉斯坐标等内在3D特征与传统3D特征(如UV坐标)相比,表现如何?
  • RQ3真实源帧中的细节在多大程度上能提升生成动作迁移视频的视觉质量,特别是在手部和面部等区域?
  • RQ4训练过程中源帧数量如何影响动作迁移模型的质量与泛化能力?
  • RQ5当源受试者表现出异常动作或衣物扰动时,该方法的失效模式是什么?

主要发现

  • 所提方法在 inception score (IS) 达到 4.015,Fréchet Inception Distance (FID) 为 51.26,显著优于先前方法(IS 3.612,FID 58.42)。
  • 消融实验表明,使用拉普拉斯特征的3D约束能带来更高的IS与更低的FID,证明图像质量与多样性均得到提升。
  • 细节增强网络有效提升了视觉清晰度并减少了模糊,尤其在面部特征与手部区域表现显著,定性对比结果验证了这一点。
  • 该方法在不同姿态间保持了良好的时序稳定性和结构一致性,避免了基线方法中常见的肢体混叠等伪影。
  • 实验表明,当源帧与目标帧的比例达到约 0.5 时,图像质量的训练收敛,为数据准备提供了指导依据。
  • 失败案例显示,当源受试者具有长发或宽松衣物时,DE-Net难以抑制不必要的视觉伪影,暴露出局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。