Skip to main content
QUICK REVIEW

[论文解读] Speech2Video Synthesis with 3D Skeleton Regularization and Expressive Body Poses

Miao Liao, Sibo Zhang|arXiv (Cornell University)|Jul 17, 2020
Human Pose and Action Recognition参考文献 33被引用 5
一句话总结

本文提出了一种两阶段的语音到视频生成框架,通过利用3D骨骼正则化和个性化手势字典,从语音音频生成逼真且富有表现力的全身视频。该方法使用RNN从音频预测3D身体姿态,注入关键姿态以增强表现力,并采用具有注意力机制的部件感知生成对抗网络,生成高分辨率、无失真的视频,细节丰富的面部和手部渲染效果显著。

ABSTRACT

In this paper, we propose a novel approach to convert given speech audio to a photo-realistic speaking video of a specific person, where the output video has synchronized, realistic, and expressive rich body dynamics. We achieve this by first generating 3D skeleton movements from the audio sequence using a recurrent neural network (RNN), and then synthesizing the output video via a conditional generative adversarial network (GAN). To make the skeleton movement realistic and expressive, we embed the knowledge of an articulated 3D human skeleton and a learned dictionary of personal speech iconic gestures into the generation process in both learning and testing pipelines. The former prevents the generation of unreasonable body distortion, while the later helps our model quickly learn meaningful body movement through a few recorded videos. To produce photo-realistic and high-resolution video with motion details, we propose to insert part attention mechanisms in the conditional GAN, where each detailed part, e.g. head and hand, is automatically zoomed in to have their own discriminators. To validate our approach, we collect a dataset with 20 high-quality videos from 1 male and 1 female model reading various documents under different topics. Compared with previous SoTA pipelines handling similar tasks, our approach achieves better results by a user study.

研究动机与目标

  • 解决现有语音到视频生成方法中缺乏表现力且物理上合理的全身动作问题。
  • 克服在有限视频记录下学习个性化手势时的数据稀疏性和多样性问题。
  • 提升生成视频的视觉保真度,减少几何失真,特别是在手部和面部区域。
  • 通过在动作序列中插入关键姿态,实现对表现力手势的控制。

提出的方法

  • 采用两阶段流程:首先,使用RNN从语音音频生成3D骨骼序列,通过人体运动学约束确保动作的物理合理性。
  • 从真实语音视频中构建个性化的关键姿态字典,实现在生成过程中注入语境相关的手势。
  • 设计一种条件生成对抗网络,采用部件感知判别器,通过空间注意力机制和对每个身体部位分别判别,提升面部、手部和头部等关键区域的细节表现。
  • 使用3D骨骼关节点作为中间监督信号,防止出现解剖学上不可行的姿态,提升动作的真实感。
  • 对TTS生成的音频添加背景噪声,使其分布与训练数据一致,避免出现失真的嘴部形状。
  • 通过学习的插值机制将关键姿态插入骨骼序列中,以增强动作的表现力。

实验结果

研究问题

  • RQ13D骨骼正则化是否能提升语音驱动的全身动作在语音到视频生成中的物理合理性和真实感?
  • RQ2在训练数据有限的情况下,学习到的个性化手势字典在增强动作表现力方面有多高效?
  • RQ3部件感知生成对抗网络是否能显著提升高分辨率视频生成的视觉保真度并减少模糊?
  • RQ4在动作序列中插入关键姿态是否能生成更具表现力且更符合人类感知自然度的视频输出?

主要发现

  • 所提方法在用户研究中获得3.42分(满分5分)的总体视觉质量评分,接近真实视频基线的4.38分,表明其具有较强的感知真实感。
  • 由真实语音音频生成的视频在所有指标上均优于TTS音频生成的视频,其感知质量显著下降,原因在于音频不自然且缺乏背景噪声。
  • 消融实验表明,80.6%的参与者更偏好插入关键姿态的视频,证实其在增强表现力方面的有效性。
  • 若从骨骼模型中移除手部建模,则持续出现模糊且无法渲染手部细节,证明显式手部建模的必要性。
  • 向TTS音频添加白噪声可改善嘴部形状的真实感,证明匹配训练数据统计特性的重要性。
  • 部件感知生成对抗网络显著提升了面部和手部区域的细节表现,相比标准生成对抗网络,有效减少了模糊和几何失真。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。