[论文解读] Human Action Generation with Generative Adversarial Networks
本文提出了一种基于条件 GAN-自编码器的框架,用于生成多样化的、连续的人体动作序列,且条件为动作类别标签和初始姿态。通过端到端地联合训练一个自编码器与一个条件 GAN,该模型能够生成新颖的、风格多样的动作——在 NTU RGB+D 数据集上进行了验证——实现了多个动作之间的无缝过渡,而无需依赖先前的动作序列。
Inspired by the recent advances in generative models, we introduce a human action generation model in order to generate a consecutive sequence of human motions to formulate novel actions. We propose a framework of an autoencoder and a generative adversarial network (GAN) to produce multiple and consecutive human actions conditioned on the initial state and the given class label. The proposed model is trained in an end-to-end fashion, where the autoencoder is jointly trained with the GAN. The model is trained on the NTU RGB+D dataset and we show that the proposed model can generate different styles of actions. Moreover, the model can successfully generate a sequence of novel actions given different action labels as conditions. The conventional human action prediction and generation models lack those features, which are essential for practical applications.
研究动机与目标
- 为了解决现有人体动作预测模型缺乏控制的问题,这些模型无法根据期望的动作类别标签或初始条件生成新颖动作。
- 实现多个连续人体动作序列的生成,实现动作之间的无缝过渡,克服基于 RNN 和 GAN 的先前模型的局限性。
- 通过随机噪声向量 $ z $ 实现生成动作中的风格控制,从而在相同动作类别内实现多样化的运动风格。
- 证明无需输入动作序列即可生成新颖动作序列的可行性,仅依赖于动作类别标签 $ l $ 和初始姿态 $ c $。
提出的方法
- 该模型将变分自编码器(VAE)与条件生成对抗网络(cGAN)相结合,以端到端的方式进行联合训练。
- 生成器的输入为一个随机噪声向量 $ z $、一个动作类别标签 $ l $ 和一个初始姿态 $ c $,输出为一组骨骼姿态序列。
- 判别器通过判断生成的动作序列是否真实,来评估其逼真度,且该判断基于 $ l $ 和 $ c $ 进行条件化。
- 自编码器组件学习人体动作序列的紧凑潜在表征,该表征用于监督 GAN 的训练。
- 通过在每次动作生成后,将 $ c $ 和 $ l $ 重新初始化为最终姿态和新的动作标签,实现序列化生成。
- 在 NTU RGB+D 数据集上进行训练,使用来自 Microsoft Kinect 的骨骼序列,生成器通过对抗损失和重建损失进行训练。
实验结果
研究问题
- RQ1生成模型能否在不依赖先前动作序列的情况下,生成多样且新颖的人体动作序列?
- RQ2该模型能否生成具有不同动作类别之间无缝过渡的连续动作序列?
- RQ3随机噪声向量 $ z $ 在同一动作类别内对运动风格的控制程度如何?
- RQ4该模型在基于初始姿态和动作类别标签生成动作方面的有效性如何?
主要发现
- 通过改变随机噪声向量 $ z $,该模型成功为同一动作类别生成了多个风格各异的动作序列,如图 3 所示。
- 该模型能够生成连续的动作序列(如坐下后紧接着起立),并实现平滑过渡,如图 5 和图 6 所示。
- 不同的初始姿态 $ c $ 导致生成序列中起始位置的不同,证实了模型对初始条件的敏感性,如图 7 所示。
- 即使没有输入动作序列,该模型仍能生成逼真且多样的运动序列,仅依赖于动作类别标签 $ l $ 和初始姿态 $ c $。
- 该框架优于先前模型(如 HP-GAN),其优势在于实现了对动作类别和初始状态的控制,并在无需 RNN 或多个 GAN 的情况下生成了新颖的动作序列。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。