[论文解读] Speech Driven Talking Face Generation from a Single Image and an Emotion Condition
本文提出了一种端到端神经网络,用于在单张参考图像和类别化情绪标签的条件下,实现语音驱动的说话人脸生成,从而实现对视觉情绪表达的精确控制。该系统在客观指标(图像质量、视听同步性、情绪表达)和主观评估中均优于最先进基线模型,展现出更优的视频真实感和情绪真实感;初步研究还证实,人类在情绪感知中更依赖视觉而非听觉线索。
Visual emotion expression plays an important role in audiovisual speech communication. In this work, we propose a novel approach to rendering visual emotion expression in speech-driven talking face generation. Specifically, we design an end-to-end talking face generation system that takes a speech utterance, a single face image, and a categorical emotion label as input to render a talking face video synchronized with the speech and expressing the conditioned emotion. Objective evaluation on image quality, audiovisual synchronization, and visual emotion expression shows that the proposed system outperforms a state-of-the-art baseline system. Subjective evaluation of visual emotion expression and video realness also demonstrates the superiority of the proposed system. Furthermore, we conduct a human emotion recognition pilot study using generated videos with mismatched emotions among the audio and visual modalities. Results show that humans respond to the visual modality more significantly than the audio modality on this task.
研究动机与目标
- 开发一种能够根据语音和类别化情绪标签生成逼真视觉情绪表达的说话人脸生成系统。
- 实现在生成的说话人脸中对情绪表达进行独立且灵活的控制,实现情绪与语音音频的解耦。
- 通过客观与主观评估,检验生成视频的真实感与情绪表现力。
- 研究在视听语音中存在音频与视觉情绪内容不匹配时,人类对情绪的感知方式。
- 为行为心理学实验以及娱乐、教育和辅助技术领域中的个性化应用提供工具。
提出的方法
- 该系统采用条件生成对抗网络(cGAN)架构,以语音频谱图、参考人脸图像和类别化情绪标签作为输入。
- 引入一种新颖的情绪判别损失,用于训练生成器以生成与输入情绪标签一致的逼真视觉情绪表达。
- 采用多感受野(MRM)损失,以提升唇部动作和头部运动的时间一致性与真实感。
- 通过对抗损失、感知损失和身份保持损失的组合训练生成器,以维持面部身份和视觉质量。
- 通过嵌入层实现情绪条件控制,将类别化情绪标签注入生成器的潜在空间。
- 训练流程包含序列判别器,以确保生成视频序列的时间连贯性。
实验结果
研究问题
- RQ1当仅以类别化情绪标签为条件时,神经网络说话人脸生成系统能否有效渲染出视觉情绪表达,且与语音音频无关?
- RQ2与最先进基线相比,所提方法在图像质量、视听同步性和情绪表达方面表现如何?
- RQ3在视听语音中模态不匹配的情况下,人类在多大程度上依赖视觉线索而非听觉线索进行情绪感知?
- RQ4根据人类评估,生成的说话人脸视频与真实视频相比,其真实感如何?
- RQ5该系统能否生成在情绪表达和真实感方面与真实视频在感知上无法区分的具有情绪表现力的说话人脸视频?
主要发现
- 所提方法在视频真实感方面相比基线实现了统计显著的提升,Wilcoxon signed-rank检验的p值为0.048。
- 主观评估显示,35.2%的受试者正确识别出生成视频中的视觉情绪,而仅25.1%正确识别出音频情绪,表明情绪感知中视觉占主导地位。
- 在考虑主要和次要情绪标签时,44.9%的响应与视觉情绪匹配,而音频情绪仅匹配33.8%,进一步证实了视觉模态的主导作用。
- 真实视频的平均真实感评分接近4分(部分真实),表明即使真实视频在感知上也比生成视频显得不够真实,可能由于分辨率较低。
- 基线模型在图像质量和唇部同步方面收到更多反馈,而所提方法在头部运动和唇部同步方面与真实视频表现相当,表明MRM损失的有效性。
- 系统成功生成了具有高感知质量与准确情绪表达的视频,该结果得到客观指标与人类评估的双重验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。