[论文解读] Audio-Driven Emotional Video Portraits
本文提出情感视频人像(Emotional Video Portraits, EVP),一种新颖的方法,用于生成高保真、由音频驱动的视频人像,并具备可控制的情感动态。通过采用交叉重建情感解耦(Cross-Reconstructed Emotion Disentanglement)将语音分离为与情感无关和与内容相关的潜在空间,并利用目标自适应人脸合成(Target-Adaptive Face Synthesis)将合成的面部关键点与目标视频姿态对齐,EVP 实现了平滑、连续的情感编辑,同时保持了高视觉保真度和准确的情感表征。
Despite previous success in generating audio-driven talking heads, most of the previous studies focus on the correlation between speech content and the mouth shape. Facial emotion, which is one of the most important features on natural human faces, is always neglected in their methods. In this work, we present Emotional Video Portraits (EVP), a system for synthesizing high-quality video portraits with vivid emotional dynamics driven by audios. Specifically, we propose the Cross-Reconstructed Emotion Disentanglement technique to decompose speech into two decoupled spaces, i.e., a duration-independent emotion space and a duration dependent content space. With the disentangled features, dynamic 2D emotional facial landmarks can be deduced. Then we propose the Target-Adaptive Face Synthesis technique to generate the final high-quality video portraits, by bridging the gap between the deduced landmarks and the natural head poses of target videos. Extensive experiments demonstrate the effectiveness of our method both qualitatively and quantitatively.
研究动机与目标
- 为解决现有音频驱动说话头生成方法中缺乏情感建模的问题,这些方法通常仅关注唇部同步,而忽略情感动态。
- 实现在仅依赖音频输入的情况下,对视频人像进行可控且连续的情感编辑。
- 弥合音频推断的面部关键点与目标视频人像自然头部姿态之间的差距,以实现高保真度合成。
- 通过跨重建学习解耦表示,克服语音中情感与内容的纠缠问题。
- 开发一个稳健的框架,在生成逼真且与人像一致的视频帧的同时,保持情感准确性。
提出的方法
- 提出交叉重建情感解耦方法,将音频分离为与时长无关的情感空间和与时长相关的语义内容空间,实现解耦表征学习。
- 使用动态时间规整(Dynamic Time Warping, DTW)生成具有对齐不等长语音的伪配对训练样本,用于交叉重建损失训练。
- 采用音频到关键点的动画模块,从解耦后的音频特征生成2D情感面部关键点序列。
- 引入一种3D感知的关键点对齐算法,将2D关键点投影到3D空间,并与目标视频的头部姿态和轮廓对齐。
- 应用边缘到视频的图像翻译网络,通过融合对齐的关键点与目标视频的边缘图和外观特征,合成高质量的视频人像。
- 采用多损失训练方案,包括交叉重建、内容、自重建和分类损失,以提升解耦效果与情感准确性。
实验结果
研究问题
- RQ1音频驱动的视频生成能否在不依赖显式情感标签的情况下实现可控且连续的情感编辑?
- RQ2如何有效从原始音频中解耦情感与语音内容,以实现独立控制?
- RQ3合成的面部关键点在多大程度上可与目标视频的3D头部姿态对齐,以减少视觉伪影?
- RQ4与端到端方法相比,基于DTW的伪对对齐的交叉重建是否能提升情感解耦与分类准确性?
- RQ5所提出的方法能否生成高保真度的视频人像,同时保留身份特征与情感动态?
主要发现
- 所提出的EVP方法在MEAD测试集上达到83.58%的情感分类准确率,显著优于Wang等人[37]的76.00%,证明了情感正确性的提升。
- 消融实验表明,若移除交叉重建损失,情感分类准确率降至69.79%,证实其在解耦中的关键作用。
- 采用3D感知关键点对齐的目标自适应人脸合成方法,显著减少了关键点与面部轮廓之间的可见伪影与偏移,如定性对比所示。
- 定量消融分析证实,四种损失(交叉重建、内容、自重建、分类)均对关键点预测与解耦性能的提升有贡献。
- 在潜在情感空间中进行线性插值可实现从悲伤到快乐的平滑、一致的情感过渡,证明了连续情感编辑能力。
- 该方法在定性和定量评估中均达到最先进性能,具有卓越的视觉质量与精准的情感控制能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。