Skip to main content
QUICK REVIEW

[论文解读] Aggregated Multi-GANs for Controlled 3D Human Motion Prediction

Zhenguang Liu, Kedi Lyu|arXiv (Cornell University)|Mar 17, 2021
Human Pose and Action Recognition参考文献 30被引用 12
一句话总结

该论文提出了一种新型框架——聚合多生成对抗网络(Aggregated Multi-GANs, AM-GAN),用于可控的3D人体动作预测,可对不同动作和身体部位实现细粒度的未来动作调控。通过将人体动作分解为局部运动链(脊柱与四肢),并分别使用独立的生成对抗网络(GAN)进行建模,再通过全局GAN进行聚合,AM-GAN在短时和长时预测任务中均实现了最先进性能,同时支持动作迁移与身体部位特异性控制。

ABSTRACT

Human motion prediction from historical pose sequence is at the core of many applications in machine intelligence. However, in current state-of-the-art methods, the predicted future motion is confined within the same activity. One can neither generate predictions that differ from the current activity, nor manipulate the body parts to explore various future possibilities. Undoubtedly, this greatly limits the usefulness and applicability of motion prediction. In this paper, we propose a generalization of the human motion prediction task in which control parameters can be readily incorporated to adjust the forecasted motion. Our method is compelling in that it enables manipulable motion prediction across activity types and allows customization of the human movement in a variety of fine-grained ways. To this aim, a simple yet effective composite GAN structure, consisting of local GANs for different body parts and aggregated via a global GAN is presented. The local GANs game in lower dimensions, while the global GAN adjusts in high dimensional space to avoid mode collapse. Extensive experiments show that our method outperforms state-of-the-art. The codes are available at https://github.com/herolvkd/AM-GAN.

研究动机与目标

  • 解决现有动作预测模型仅能针对同一活动预测单一、确定性未来序列的局限性。
  • 实现可控制的动作生成,支持向新动作的过渡以及对特定身体部位的细粒度控制。
  • 通过采用分而治之策略,利用局部GAN降低高维动作生成的复杂度。
  • 在保持时间连贯性与自然动力学特性的前提下,提升短时与长时动作预测的质量。
  • 建立新的可控3D人体动作预测基准,支持可定制化、多动作与多部位控制。

提出的方法

  • 该框架采用分层GAN架构,包含五个子生成对抗网络:一个用于中心脊柱,四个分别用于四肢,实现局部动作建模。
  • 每个局部GAN在低维空间中生成其对应运动链的动作,降低复杂度并提升训练稳定性。
  • 一个全局GAN在高维姿态空间中聚合所有局部GAN的输出,以确保整体动作的一致性并平衡各运动链间的动力学关系。
  • 生成器通过控制参数进行条件输入,指定目标动作或特定身体部位的行为,从而实现动作迁移与细粒度控制。
  • 模型同时使用局部与全局判别器,联合优化短时准确性与长时一致性,缓解模式崩溃问题。
  • 通过对抗损失、重建损失与循环一致性正则化,端到端训练框架,确保生成动作的逼真性与多样性。

实验结果

研究问题

  • RQ1动作预测模型能否生成多样且合理的未来动作序列,使其偏离当前活动?
  • RQ2模型能否在未来的动作预测中实现对单个身体部位的细粒度控制?
  • RQ3模型能否实现从一种动作到另一种动作的平滑过渡,例如从行走过渡到进食?
  • RQ4将动作生成分解为局部运动链是否能提升预测性能与可控性?
  • RQ5聚合式GAN架构是否能在短时与长时动作预测中均优于单一GAN或多GAN基线模型?

主要发现

  • AM-GAN在Human3.6M数据集上,于短时与长时3D人体动作预测任务中均达到新的最先进性能。
  • 该模型显著提升了复杂、非周期性动作(如“讨论”)的预测准确性,此类动作的周期性低且运动不规则。
  • 消融实验表明,使用子GAN与分而治之策略的性能优于单一GAN,尤其在复杂动作上优势更明显。
  • 局部判别器提升短时预测质量,而全局判别器则增强长时动作的一致性与连贯性。
  • 可视化结果表明,AM-GAN生成的动作序列比HMR与QuaterNet更自然、更平滑、更逼真。
  • 该框架成功生成了动作间的合理过渡(如从行走到进食),并实现了身体部位特异性控制(如身体行走时右臂进行进食动作)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。