[论文解读] Transflower: probabilistic autoregressive dance generation with multimodal attention.
本文提出 Transflower,一种用于3D舞蹈生成的基于概率的自回归模型,通过多模态Transformer编码器关注长程音乐与运动上下文,并结合归一化流来建模姿态分布。在迄今为止最大的3D舞蹈数据集上进行评估,该模型在生成多样化、逼真且与音乐匹配的舞蹈动作方面优于基线模型。
Dance requires skillful composition of complex movements that follow rhythmic, tonal and timbral features of music. Formally, generating dance conditioned on a piece of music can be expressed as a problem of modelling a high-dimensional continuous motion signal, conditioned on an audio signal. In this work we make two contributions to tackle this problem. First, we present a novel probabilistic autoregressive architecture that models the distribution over future poses with a normalizing flow conditioned on previous poses as well as music context, using a multimodal transformer encoder. Second, we introduce the currently largest 3D dance-motion dataset, obtained with a variety of motion-capture technologies, and including both professional and casual dancers. Using this dataset, we compare our new model against two baselines, via objective metrics and a user study, and show that both the ability to model a probability distribution, as well as being able to attend over a large motion and music context are necessary to produce interesting, diverse, and realistic dance that matches the music.
研究动机与目标
- 开发一种能够生成多样化、逼真且与音乐条件相关的3D舞蹈动作的生成模型。
- 解决在复杂音频信号条件下建模高维连续运动序列的挑战。
- 通过集成多模态Transformer编码器,实现在运动和音乐中的长程上下文建模。
- 通过客观指标和人类评估相结合的方式,评估模型在真实感和音乐对齐方面的表现。
- 发布目前最大的3D舞蹈动作数据集,该数据集通过多种动作捕捉系统采集,涵盖专业和非专业舞者。
提出的方法
- 该模型采用基于概率的自回归框架,逐步预测未来姿态,同时利用归一化流建模完整的条件分布。
- 多模态Transformer编码器处理音频和运动序列,实现两种模态中长程依赖关系的注意力机制。
- 归一化流以先前姿态和多模态上下文嵌入为条件,实现灵活且富有表现力的概率密度估计。
- 架构整合了预训练音乐编码器生成的音频嵌入与基于Transformer的运动编码器生成的运动嵌入。
- 模型通过最大似然估计进行端到端训练,以优化观测到的运动序列的对数似然。
- 该框架支持从学习到的分布中采样,从而实现多样化且逼真的舞蹈生成。
实验结果
研究问题
- RQ1基于归一化流的概率自回归模型是否能比确定性基线生成更多样化、更逼真的3D舞蹈动作?
- RQ2在长程音乐与运动上下文中使用多模态注意力,在提升舞蹈与音乐对齐方面有多高效?
- RQ3建模未来姿态的完整分布是否能带来优于点估计的生成质量?
- RQ4不同的动作捕捉技术与舞者类型如何影响舞蹈动作数据的质量与多样性?
- RQ5在生成高质量舞蹈序列时,分布建模与长上下文注意力的相对贡献分别是什么?
主要发现
- 所提出的模型在客观指标和用户研究中均优于两个基线模型,表现出更优的真实感与音乐对齐能力。
- 消融研究证实,通过归一化流进行分布建模与长上下文多模态注意力对高质量生成均至关重要。
- 用户研究表明,当两个组件同时存在时,生成的动作在多样性与真实感方面获得更高评分。
- 该模型生成的运动序列与输入音乐表现出强烈的节奏与音调同步性。
- 新发布的3D舞蹈动作数据集支持更稳健的训练与评估,为未来舞蹈生成研究提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。