Skip to main content
QUICK REVIEW

[论文解读] Human Motion Transfer from Poses in the Wild

Jian Ren, Menglei Chai|arXiv (Cornell University)|Apr 7, 2020
Human Pose and Action Recognition参考文献 55被引用 10
一句话总结

该论文提出了一种两阶段姿态到视频的图像转换框架,通过统一的成对与非成对学习、姿态增强以及精炼网络,实现了从真实场景姿态中高保真的人体动作迁移,即使在未见过或具有挑战性的姿态下也能生成鲁棒、时序一致且逼真的结果。该方法在多个数据集上显著优于当前最先进(SOTA)方法,FID(5.9453)和SSIM(0.9666)指标均得到提升。

ABSTRACT

In this paper, we tackle the problem of human motion transfer, where we synthesize novel motion video for a target person that imitates the movement from a reference video. It is a video-to-video translation task in which the estimated poses are used to bridge two domains. Despite substantial progress on the topic, there exist several problems with the previous methods. First, there is a domain gap between training and testing pose sequences--the model is tested on poses it has not seen during training, such as difficult dancing moves. Furthermore, pose detection errors are inevitable, making the job of the generator harder. Finally, generating realistic pixels from sparse poses is challenging in a single step. To address these challenges, we introduce a novel pose-to-video translation framework for generating high-quality videos that are temporally coherent even for in-the-wild pose sequences unseen during training. We propose a pose augmentation method to minimize the training-test gap, a unified paired and unpaired learning strategy to improve the robustness to detection errors, and two-stage network architecture to achieve superior texture quality. To further boost research on the topic, we build two human motion datasets. Finally, we show the superiority of our approach over the state-of-the-art studies through extensive experiments and evaluations on different datasets.

研究动机与目标

  • 解决训练与测试姿态序列之间的领域差距,特别是针对训练过程中未见的真实场景姿态。
  • 提升对姿态检测误差的鲁棒性,例如在真实视频中出现的关键点缺失或错位问题。
  • 通过仅关注前景合成,实现从稀疏姿态输入中生成高保真、时序一致的视频。
  • 通过引入统一的成对与非成对学习策略,弥合成对监督学习与非成对数据之间的差距。
  • 即使在训练分布之外的极端或复杂动作中,也能实现逼真的纹理生成与运动一致性。

提出的方法

  • 提出两阶段网络架构:首先,姿态到图像转换网络生成初始前景帧;其次,精炼网络提升纹理质量和清晰度。
  • 在训练过程中应用姿态增强,通过随机丢弃关键点通道并缩放身体部位长度,以模拟检测误差并提高鲁棒性。
  • 在训练流程中整合非成对学习,使用大规模单人活动(SPA)数据集作为真实场景源数据,实现对未见姿态的泛化能力。
  • 采用联合判别器设计,同时支持成对与非成对训练分支,实现跨域的联合优化。
  • 专注于仅前景生成,以减少背景伪影,提升计算效率,并便于背景替换。
  • 将连续的姿态序列作为输入,以保持帧间的时间一致性。

实验结果

研究问题

  • RQ1姿态到视频模型能否有效泛化到与训练数据显著不同的真实场景姿态序列?
  • RQ2在视频生成过程中,如何减轻姿态检测误差的影响,以保持结构一致性和真实感?
  • RQ3与单阶段生成相比,两阶段精炼网络在提升纹理质量与减少伪影方面能实现多大程度的改进?
  • RQ4与纯监督训练相比,结合成对与非成对学习是否能提升泛化能力与鲁棒性?
  • RQ5在动作迁移任务中,仅前景合成是否能实现比全帧生成更高的视觉保真度与可重用性?

主要发现

  • 完整方法(PL-UL-Stage2)的SSIM达到0.9666,FID为5.9453,显著优于消融实验变体与SOTA基线方法。
  • 姿态增强(DA)提升了鲁棒性,减少了在关键点检测误差下的伪影并提高了稳定性,与vid2vid的定性对比结果表明其优势。
  • 两阶段精炼网络显著增强了纹理细节与边界准确性,相比单阶段模型减少了孔洞与肢体缺失问题。
  • 非成对学习提升了对未见真实场景姿态的泛化能力,即使在训练数据中未包含的复杂或极端动作中也能成功实现动作迁移。
  • 视觉消融研究证实,若移除任一组件——尤其是非成对学习或精炼模块——将导致明显伪影、模糊纹理与不一致的身体部位。
  • 即使输入姿态包含缺失或错位的关键点,该方法仍能成功生成完整、连贯且逼真的前景图像,如图4中的挑战性案例所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。