[论文解读] Talking-head Generation with Rhythmic Head Motion
本文提出一种3D感知的生成网络,结合混合嵌入与非线性组合模块,可生成逼真、口型同步的说话头像视频,并实现可控的、有节奏的头部运动。通过使用短参考视频和音频显式建模头部运动与面部表情,该方法在时间一致性与身份保持方面优于当前最先进方法。
When people deliver a speech, they naturally move heads, and this rhythmic head motion conveys prosodic information. However, generating a lip-synced video while moving head naturally is challenging. While remarkably successful, existing works either generate still talkingface videos or rely on landmark/video frames as sparse/dense mapping guidance to generate head movements, which leads to unrealistic or uncontrollable video synthesis. To overcome the limitations, we propose a 3D-aware generative network along with a hybrid embedding module and a non-linear composition module. Through modeling the head motion and facial expressions1 explicitly, manipulating 3D animation carefully, and embedding reference images dynamically, our approach achieves controllable, photo-realistic, and temporally coherent talking-head videos with natural head movements. Thoughtful experiments on several standard benchmarks demonstrate that our method achieves significantly better results than the state-of-the-art methods in both quantitative and qualitative comparisons. The code is available on https://github.com/ lelechen63/Talking-head-Generation-with-Rhythmic-Head-Motion.
研究动机与目标
- 生成逼真、口型同步的说话头像视频,具备自然有节奏的头部运动,以传达语调信息。
- 克服现有方法的局限性,这些方法会产生静止的面部或依赖稀疏/密集监督来生成头部运动。
- 实现在可控生成中,面部表情由音频驱动,头部运动则从参考视频中学习。
- 通过3D感知建模与动态外观嵌入,提升视觉一致性与身份保持能力。
- 在无需输入完整视频帧进行编辑的前提下,实现高保真度合成。
提出的方法
- 引入3D感知模块,提供几何监督以稳定GAN训练,并在头部运动过程中提升对齐精度。
- 采用混合嵌入模块,动态聚合K个参考帧的外观特征,以建模身份与运动特征。
- 使用非线性组合模块,将面部表情、头部运动与外观特征精确对齐后融合。
- 从3秒参考视频与音频中学习有节奏的头部运动,实现可控且自然的头部姿态过渡。
- 将头部运动与面部表情建模解耦,以提升解缠与控制能力。
- 端到端训练,仅使用音频与参考帧,避免依赖关键点标注或完整视频编辑。
实验结果
研究问题
- RQ1生成模型能否在无需完整视频帧作为输入的前提下,生成逼真、具有自然有节奏头部运动的说话头像视频?
- RQ2在音频驱动的视频生成过程中,如何显式解耦并控制头部运动与面部表情?
- RQ33D感知建模能否提升身份保持能力并减少动态人脸生成中的视觉伪影?
- RQ4动态参考帧嵌入是否相比全局外观编码能带来更好的泛化能力与视觉一致性?
- RQ5与当前最先进的音频驱动与关键点驱动方法相比,该方法在感知质量与口型同步准确性方面表现如何?
主要发现
- 所提方法在VoxCeleb2与LRS3-TED数据集上,无论在定量指标还是定性评估中均达到最先进性能。
- 该方法在FID、SSIM与CSIM得分上显著优于先前工作,其中CSIM表明其在未见身份上的泛化能力极强。
- 用户研究表明,与静止面部版本相比,具有自然头部运动的视频被评价为显著更逼真且同步性更好。
- 消融实验表明,若移除3D感知模块或非线性组合模块,将导致身份漂移及面部边缘区域出现视觉伪影。
- 随着K(参考帧数量)增大,性能持续提升,证明了动态嵌入策略的有效性。
- 即使在大幅面部形变下,该方法仍能生成高质量、时间上一致的视频,优于依赖关键点或帧级监督的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。