[论文解读] Freeform Body Motion Generation from Speech
本文提出 FreeMo,一种两流扩散模型,将共话语音身体动作解耦为随机姿态模式与基于语调条件的节奏动态,实现多样化、高质量且与语音同步的自由形式动作生成。其在动作多样性、质量和同步性方面优于基线模型,尤其在多说话人数据上训练时表现更优。
People naturally conduct spontaneous body motions to enhance their speeches while giving talks. Body motion generation from speech is inherently difficult due to the non-deterministic mapping from speech to body motions. Most existing works map speech to motion in a deterministic way by conditioning on certain styles, leading to sub-optimal results. Motivated by studies in linguistics, we decompose the co-speech motion into two complementary parts: pose modes and rhythmic dynamics. Accordingly, we introduce a novel freeform motion generation model (FreeMo) by equipping a two-stream architecture, i.e., a pose mode branch for primary posture generation, and a rhythmic motion branch for rhythmic dynamics synthesis. On one hand, diverse pose modes are generated by conditional sampling in a latent space, guided by speech semantics. On the other hand, rhythmic dynamics are synced with the speech prosody. Extensive experiments demonstrate the superior performance against several baselines, in terms of motion diversity, quality and syncing with speech. Code and pre-trained models will be publicly available through https://github.com/TheTempAccount/Co-Speech-Motion-Generation.
研究动机与目标
- 解决共话语音动作的非确定性与自由形式特性,其语音与动作之间不存在一一对应关系。
- 将动作分解为姿态模式(姿势状态)与节奏动态(与语调同步的运动),分别建模随机性与同步性。
- 在不依赖说话人特定风格或固定手势模板的前提下,实现高多样性动作生成。
- 通过在多说话人数据上训练,提升跨说话人的泛化能力,同时保持强语音同步性。
提出的方法
- 使用基于变自编码器(VAE)的姿态模式分支,在潜在空间中通过条件采样生成多样化姿势,由语音语义引导。
- 实现独立的节奏运动分支,利用语音能量和音高轮廓推断快速、与语调锁定的手部动态。
- 通过结合动作质量、多样性与语音同步性的多任务损失,端到端训练两流架构。
- 利用多说话人训练数据学习个体间共享的动作模式,提升泛化能力与多样性。
- 在潜在空间中应用基于扩散的生成过程,实现具有可控随机性的高保真动作采样。
- 通过神经渲染器将生成的2D骨骼序列映射为RGB帧,支持端到端视频生成。
实验结果
研究问题
- RQ1我们能否通过将语音到身体动作的非确定性映射分解为姿态模式与节奏动态来建模?
- RQ2将姿态生成与节奏动态分离,是否能提升动作多样性并增强与语音的同步性?
- RQ3单一模型能否在无需说话人特定条件的情况下泛化至多个说话人?
- RQ4与确定性基线相比,该模型在生成自由形式、自然外观的动作方面表现如何?
- RQ5多说话人训练在多大程度上能提升动作多样性,同时保持语音同步性?
主要发现
- FreeMo 在多样性方面显著优于说话人特定和基于模板的基线模型,尤其在多说话人数据上训练时表现更优。
- 单次生成即可从不同说话人生成具有多样化姿势的动作序列,如最近邻可视化所示。
- 节奏动态与语音语调有效同步,语速越快,动作越快;语速越慢,动作越平滑、越安静。
- 即使在多说话人数据上训练,模型仍保持强语音同步性,其同步指标优于说话人特定模型。
- 端到端视频生成展示了从业余语音输入生成逼真‘专业级’对话视频的可行性。
- 由于分布外泛化,多说话人训练下的质量得分略有下降,表明多样性与保真度之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。