[论文解读] Every Smile is Unique: Landmark-Guided Diverse Smile Generation
该论文提出CMM-Net,一种条件多模态网络,通过利用面部关键点作为动态表征,从单张中性人脸图像生成多样且逼真的微笑视频。该方法使用变分自编码器对关键点进行嵌入,采用条件LSTM生成特定表情的嵌入向量,并通过多模态循环生成器输出不同的关键点序列,再将其转换为高保真度视频,在逼真度和动作单元动态表现上优于基线模型。
Each smile is unique: one person surely smiles in different ways (e.g., closing/opening the eyes or mouth). Given one input image of a neutral face, can we generate multiple smile videos with distinctive characteristics? To tackle this one-to-many video generation problem, we propose a novel deep learning architecture named Conditional Multi-Mode Network (CMM-Net). To better encode the dynamics of facial expressions, CMM-Net explicitly exploits facial landmarks for generating smile sequences. Specifically, a variational auto-encoder is used to learn a facial landmark embedding. This single embedding is then exploited by a conditional recurrent network which generates a landmark embedding sequence conditioned on a specific expression (e.g., spontaneous smile). Next, the generated landmark embeddings are fed into a multi-mode recurrent landmark generator, producing a set of landmark sequences still associated to the given smile class but clearly distinct from each other. Finally, these landmark sequences are translated into face videos. Our experimental results demonstrate the effectiveness of our CMM-Net in generating realistic videos of multiple smile expressions.
研究动机与目标
- 为解决面部表情的一对多视频生成问题,特别是从单张中性人脸图像生成多个不同的微笑视频。
- 建模同一表情类别内(如自发性微笑与摆拍微笑)面部表情的动态差异,例如眼部与口部动作的变化。
- 通过面部关键点显式编码表情动态,提升面部表情生成的鲁棒性与逼真度。
- 构建一个在生成过程中保持身份一致性的框架,同时生成多个独特、高质量的微笑序列,且具有不同的时间动态特性。
- 通过生成多样且逼真的表情序列,推动在虚拟形象动画、人脸识别以及合成数据生成等领域的应用。
提出的方法
- 使用变分自编码器(VAE)从训练数据中学习面部关键点序列的紧凑且解耦的嵌入表征。
- 采用条件循环网络(LSTM)根据输入的中性人脸关键点和指定的表情标签(如自发性或摆拍微笑)生成关键点嵌入序列。
- 采用由多个并行LSTM组成的多模态循环生成器,接收条件嵌入后,为同一表情类别生成一组不同的关键点嵌入序列。
- 将生成的关键点序列输入到类似U-Net的图像翻译网络中,以合成保持身份与面部细节的逼真人脸视频。
- 通过对抗损失、感知损失和重建损失进行端到端训练,以确保生成视频的逼真度与保真度。
- 多模态生成器无需额外的真实标签,其多样性通过潜在空间的随机性及多头生成机制自动学习。
实验结果
研究问题
- RQ1我们能否从同一张中性人脸图像生成多个明显不同且逼真的微笑视频,即使输入完全相同?
- RQ2如何有效利用面部关键点来建模同一类别内(如自发性微笑中不同的眼部与口部动作)面部表情的动态差异?
- RQ3与标准视频生成模型相比,所提出的基于关键点引导的多模态生成方法在逼真度与多样性方面提升程度如何?
- RQ4生成的面部表情动态(如动作单元强度)能否与真实人类表情高度匹配?
- RQ5使用条件与多模态循环网络是否能更有效地保持生成视频中的身份一致性与视觉质量?
主要发现
- CMM-Net在SSIM指标上达到最高分(0.898),且与真实序列的IS分数差异最小(ΔIS = 0.12),表明其在图像质量和逼真度方面表现更优。
- 在用户评估中,68.2%的标注者更偏好CMM-Net生成的视频,高于Video GAN;65.5%更偏好CMM-Net,高于CRA-Net,证实其感知逼真度更高。
- CMM-Net生成序列中脸颊提升动作单元(AU)的动态与原始数据高度一致,距离分别为2.234(UvA-NEMO 自发性)与1.472(UvA-NEMO 摆拍),显著低于Video GAN的2.976与2.618。
- 多模态生成器成功为同一表情类别生成视觉上明显不同的关键点序列,经视觉检查与定量动作单元动态分析验证。
- CMM-Net在所有评估指标(包括SSIM、IS及AU曲线相似度)上均优于Video GAN与CRA-Net,证明其在生成多样、高质量视频方面的有效性。
- 模型在不同生成序列间保持了身份一致性,合成视频中面部外观与结构稳定,即使表达动态各异亦能维持一致身份特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。