[论文解读] X2Face: A network for controlling face generation by using images, audio, and pose codes
X2Face 提出了一种自监督神经网络,通过图像、音频或姿态编码控制人脸生成,无需标注数据。它从视频数据中学习一种身份不变的嵌入式人脸表征,并利用该表征将另一张人脸、音频或姿态编码作为驱动信号,实现对源人脸的动画化,从而实现鲁棒、可控且多功能的人脸动画,支持零样本模态迁移。
The objective of this paper is a neural network model that controls the pose and expression of a given face, using another face or modality (e.g. audio). This model can then be used for lightweight, sophisticated video and image editing. We make the following three contributions. First, we introduce a network, X2Face, that can control a source face (specified by one or more frames) using another face in a driving frame to produce a generated frame with the identity of the source frame but the pose and expression of the face in the driving frame. Second, we propose a method for training the network fully self-supervised using a large collection of video data. Third, we show that the generation process can be driven by other modalities, such as audio or pose codes, without any further training of the network. The generation results for driving a face with another face are compared to state-of-the-art self-supervised/supervised methods. We show that our approach is more robust than other methods, as it makes fewer assumptions about the input data. We also show examples of using our framework for video face editing.
研究动机与目标
- 开发一种自监督框架,仅使用视频数据控制人脸生成,无需姿态、表情或身份标注。
- 通过从驱动帧迁移姿态和表情,同时保留源人脸的身份,实现可控的人脸动画。
- 将框架扩展为可由非视觉模态(如音频或姿态编码)驱动,且无需微调。
- 通过使用学习到的嵌入式人脸表征作为稳定的身份不变纹理图,实现视频编辑。
- 在对输入数据假设极少的前提下,证明方法在非约束的真实世界视频数据上的鲁棒性与泛化能力。
提出的方法
- 训练一个双分支网络:一个嵌入网络将源人脸编码为解耦的、身份保持的表征,一个驱动网络将该表征映射到生成帧。
- 在视频帧对(源帧与驱动帧)上使用自监督对比学习,学习解耦表征,无需任何标签。
- 通过强制嵌入网络对源帧中姿态和表情变化保持不变,实现身份与运动/姿态/表情的解耦。
- 训练驱动网络,从嵌入的源人脸和由驱动帧提取的驱动向量中重建驱动帧。
- 通过在训练后学习从音频特征或姿态编码到驱动向量空间的线性投影,实现模态迁移。
- 通过直接修改嵌入式人脸并将其重新应用于一系列驱动帧,将嵌入式人脸用作视频编辑的UV纹理图。
实验结果
研究问题
- RQ1自监督神经网络能否在无任何标注的情况下,从未受约束的视频数据中学习到解耦的、身份保持的人脸表征?
- RQ2同一训练好的网络能否在未见身份的情况下,通过从驱动帧迁移姿态和表情,成功生成逼真的人脸动画?
- RQ3该网络能否在不微调的情况下,有效由非视觉模态(如音频或姿态编码)驱动?
- RQ4嵌入式人脸表征在多大程度上可作为视频编辑任务(如添加面部装饰)的稳定基础?
- RQ5与最先进的监督和自监督人脸动画方法相比,该方法在鲁棒性和质量方面表现如何?
主要发现
- X2Face 在无需任何姿态、表情或身份标注的情况下,实现了对多样化身份和姿态的鲁棒人脸动画。
- 该模型成功利用音频输入进行人脸动画,生成与语音内容对齐的嘴唇运动,即使音频来自不同说话人或与源视频内容无关。
- 嵌入式人脸表征在不同姿态和表情下保持稳定,支持通过直接修改嵌入式人脸实现一致的视频编辑。
- 该框架支持使用同一修改后的嵌入式人脸在不同身份间进行编辑,如在侧视和正脸视角下均能一致地渲染纹身和疤痕。
- 该方法在鲁棒性方面优于最先进的自监督和监督方法,尤其在处理非约束或未见身份的数据时表现更优。
- 尽管生成质量略低于专用的人脸交换模型,X2Face 在多功能性、自监督性和可控性之间实现了出色的平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。