[论文解读] Music-oriented Dance Video Synthesis with Pose Perceptual Loss
本文提出了一种基于两阶段 GAN 的框架,用于音乐驱动的舞蹈视频生成,能够从任意给定音乐生成逼真且节拍对齐的舞蹈视频。该方法引入了一种新颖的姿态感知损失,以在噪声较大的 OpenPose 骨骼数据上进行训练,并采用双判别器(局部时序与全局内容)确保动作连贯性与节奏对齐,实现用户感知的逼真度,与专业编舞相当。
We present a learning-based approach with pose perceptual loss for automatic music video generation. Our method can produce a realistic dance video that conforms to the beats and rhymes of almost any given music. To achieve this, we firstly generate a human skeleton sequence from music and then apply the learned pose-to-appearance mapping to generate the final video. In the stage of generating skeleton sequences, we utilize two discriminators to capture different aspects of the sequence and propose a novel pose perceptual loss to produce natural dances. Besides, we also provide a new cross-modal evaluation to evaluate the dance quality, which is able to estimate the similarity between two modalities of music and dance. Finally, a user study is conducted to demonstrate that dance video synthesized by the presented approach produces surprisingly realistic results. The results are shown in the supplementary video at https://youtu.be/0rMuFMZa_K4
研究动机与目标
- 从任意音乐输入生成照片级真实感、节拍对齐的舞蹈视频,实现个性化内容创作。
- 解决现有方法中音乐到舞蹈映射模糊以及动作不自然的问题。
- 在无真人标注真实姿态的噪声、弱监督骨骼序列上有效训练模型。
- 开发一种新颖的跨模态评估指标,衡量音乐与舞蹈动作之间的相似性。
- 证明合成的舞蹈视频在用户研究中与真实编舞难以区分。
提出的方法
- 该框架采用两阶段流程:首先从音乐生成人体骨骼序列,然后通过学习的姿态到外观映射将骨骼序列转换为照片级真实感视频。
- 音乐编码器将 0.1 秒的音频片段处理为嵌入表示,输入双向 GRU 和姿态生成器,以生成骨骼序列。
- 提出一种新颖的姿态感知损失,通过比较预测骨骼与参考骨骼的中间特征表示,提升动作的合理性。
- 使用两个判别器:局部时序判别器用于强制实现短期动作连贯性与节奏对齐,全局内容判别器用于确保长期动作和谐与情感一致性。
- 提出一种基于预训练音乐特征提取器和三元组度量学习方法的跨模态评估指标,用于衡量音乐与生成舞蹈序列之间的相似性。
- 模型采用对抗损失进行端到端训练,姿态感知损失使模型能够在无真人验证标签的噪声 OpenPose 数据上实现有效训练。
实验结果
研究问题
- RQ1深度学习模型能否在无需高质量、人工标注骨骼数据的情况下,从任意音乐生成逼真且节拍对齐的舞蹈视频?
- RQ2当在 OpenPose 生成的噪声、不完美的骨骼序列上训练时,姿态感知损失如何提升动作的合理性?
- RQ3双判别器架构在多大程度上能增强生成舞蹈序列的连贯性与节奏对齐?
- RQ4新颖的跨模态评估指标能否有效衡量音乐与舞蹈动作之间的语义相似性?
- RQ5在感知质量与真实感方面,合成的舞蹈视频与真实编舞相比如何?
主要发现
- 在包含 27 名参与者(其中 7 名为专业舞者)的用户研究中,43.0% 的比较结果更倾向于合成舞蹈序列而非真实骨骼数据,表明其感知真实感与人类编舞相当。
- 所提出的姿态感知损失显著提升了动作合理性,即使在噪声较大的 OpenPose 数据上训练,也能减少不自然姿态的出现。
- 双判别器设置(局部与全局)生成的骨骼序列在连贯性与节奏对齐方面优于仅使用 L1/L2 或标准 GAN 损失的基线模型。
- 跨模态评估指标成功估计了音乐与舞蹈之间的相似性,结果通过 K-means(K=5)聚类与最大均值差异分析得到验证。
- 使用 BRISQUE 进行的定量评估显示,当同时应用全局内容判别器与姿态感知损失时,视频质量得到提升,较低的分数表示更高的感知质量。
- 随机基线(Rand Frame 与 Rand Seq)的 BRISQUE 分数显著更差,证实模型性能并非源于随机帧或序列选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。