[论文解读] DINet: Deformation Inpainting Network for Realistic Face Visually Dubbing on High Resolution Video
本文提出DINet,一种用于高分辨率视频的形变修复图像生成网络,实现高保真、照片级真实的面部视觉配音。通过将参考面部特征图根据音频驱动的嘴部形状和头部姿态进行空间形变,再利用学习到的解码器修复嘴部区域,DINet在保留高频纹理细节方面优于直接生成方法,在高分辨率基准数据集上的定性和定量评估中均达到最先进水平。
For few-shot learning, it is still a critical challenge to realize photo-realistic face visually dubbing on high-resolution videos. Previous works fail to generate high-fidelity dubbing results. To address the above problem, this paper proposes a Deformation Inpainting Network (DINet) for high-resolution face visually dubbing. Different from previous works relying on multiple up-sample layers to directly generate pixels from latent embeddings, DINet performs spatial deformation on feature maps of reference images to better preserve high-frequency textural details. Specifically, DINet consists of one deformation part and one inpainting part. In the first part, five reference facial images adaptively perform spatial deformation to create deformed feature maps encoding mouth shapes at each frame, in order to align with the input driving audio and also the head poses of the input source images. In the second part, to produce face visually dubbing, a feature decoder is responsible for adaptively incorporating mouth movements from the deformed feature maps and other attributes (i.e., head pose and upper facial expression) from the source feature maps together. Finally, DINet achieves face visually dubbing with rich textural details. We conduct qualitative and quantitative comparisons to validate our DINet on high-resolution videos. The experimental results show that our method outperforms state-of-the-art works.
研究动机与目标
- 解决在少样本学习条件下,为高分辨率视频生成照片级真实感面部视觉配音的挑战。
- 克服直接像素生成方法在嘴部区域难以保留高频纹理细节的局限。
- 通过利用参考图像特征的空间形变而非端到端生成,提升唇部同步与面部真实感。
- 在准确对齐音频驱动的嘴部动作的同时,保持身份、头部姿态和上半张脸表情的一致性。
- 在现有SOTA方法的基础上,于高分辨率视频数据集上实现更优性能。
提出的方法
- DINet由两个主要部分组成:形变部分和修复部分。
- 形变部分采用自适应空间变换(AdaAT),根据驱动音频和源图像头部姿态对五张参考面部图像的特征图进行形变。
- AdaAT通过区域级形变与正则化处理,相比注意力机制或稠密光流等像素级方法,能更好地保留结构与纹理细节。
- 修复部分通过卷积解码器将形变后的嘴部特征与源图像特征(包括头部姿态和上半张脸表情)融合,以重建嘴部区域。
- 网络通过感知损失、对抗性损失和音视频同步损失进行训练,以确保生成结果的逼真性与对齐性。
- 消融实验证明,形变机制优于直接生成,且AdaAT在特征形变方面优于注意力机制与稠密光流。
实验结果
研究问题
- RQ1空间形变参考图像特征是否能提升高分辨率面部视觉配音中高频纹理的保留?
- RQ2与直接像素生成相比,基于形变的特征操作在视觉保真度与唇部同步方面表现如何?
- RQ3不同形变机制(如AdaAT vs. 注意力机制 vs. 稠密光流)对纹理保留与伪影生成的影响如何?
- RQ4少样本方法在生成基于音频的逼真嘴部动作时,能在多大程度上保持身份与头部姿态的一致性?
- RQ5所提出的形变-修复框架是否在高分辨率视频基准上优于现有SOTA方法?
主要发现
- 在HDTF数据集上,DINet的SSIM(0.9425)、PSNR(30.0082)达到最高,LPIPS(0.0289)最低,优于所有消融变体与SOTA方法。
- 消融实验表明,若移除形变组件,SSIM降至0.9147,PSNR降至26.1665,表明其在细节保留中起关键作用。
- 若省略修复模块,将出现明显伪影且质量下降(SSIM: 0.8691,PSNR: 26.0071),证实特征融合的必要性。
- 使用注意力或稠密光流进行形变会导致更高的LPIPS(0.0433与0.0656)与更多伪影,尤其在眼睛与视线等面部结构区域。
- 用户研究表明,DINet的逼真度得分最高(5分制中为3.4分),优于Wav2Lip(2.4分)、ATVG(2.9分)、MakeItTalk(3.1分)与PC-AVS(3.3分)。
- 该方法能有效保留胡须、鼻唇沟等精细纹理,而这些细节在直接生成方法中常被模糊化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。