Skip to main content
QUICK REVIEW

[论文解读] One-Shot Free-View Neural Talking-Head Synthesis for Video Conferencing

Ting-Chun Wang, Arun Mallya|arXiv (Cornell University)|Nov 30, 2020
Advanced Vision and Imaging参考文献 97被引用 22
一句话总结

本文提出了一种单图像神经对话头视频合成模型,通过新颖的无监督3D关键点表征,从单张源图像和驱动视频生成高质量对话头视频。该方法通过解耦身份与运动信息,实现自由视角合成,在保持与H.264在CRF 36下相当视觉质量的同时,实现10倍带宽压缩,并支持动态视角旋转与自适应关键点压缩,适用于视频会议场景。

ABSTRACT

We propose a neural talking-head video synthesis model and demonstrate its application to video conferencing. Our model learns to synthesize a talking-head video using a source image containing the target person's appearance and a driving video that dictates the motion in the output. Our motion is encoded based on a novel keypoint representation, where the identity-specific and motion-related information is decomposed unsupervisedly. Extensive experimental validation shows that our model outperforms competing methods on benchmark datasets. Moreover, our compact keypoint representation enables a video conferencing system that achieves the same visual quality as the commercial H.264 standard while only using one-tenth of the bandwidth. Besides, we show our keypoint representation allows the user to rotate the head during synthesis, which is useful for simulating face-to-face video conferencing experiences.

研究动机与目标

  • 通过解耦身份与运动信息,解决基于2D的单图像对话头视频合成中固定视角的局限性,实现在不依赖3D图形模型情况下的局部自由视角合成。
  • 开发一种紧凑的无监督3D关键点表征,将身份特异性外观与运动相关动态分离。
  • 通过仅传输关键点表征与残差,实现带宽高效的视频会议,与H.264相比数据使用量减少10倍。
  • 在合成过程中支持动态视角操作(如头部旋转),以模拟面对面视频会议体验。
  • 设计自适应与二值化编码方案,用于关键点元数据与残差,以在不同网络条件下进一步降低带宽。

提出的方法

  • 以无监督方式从视频序列中学习一种新颖的3D关键点表征,将身份与运动信息分解为独立分量。
  • 使用深度神经网络,通过结合源图像的外观与3D关键点中编码的运动线索,合成对话头视频。
  • 在推理阶段对关键点表征应用3D变换(旋转、平移、形变),生成新视角。
  • 实施自适应关键点方案,根据视频复杂度动态减少关键点数量,实现带宽自适应。
  • 采用二值潜在码编码方案对真实帧与重建帧之间的残差进行编码,通过算术编码降低传输成本。
  • 仅在需要时(例如源图像质量下降时)集成残差编码,从而在不持续重传的情况下提升重建保真度。

实验结果

研究问题

  • RQ1无监督3D关键点表征能否在不依赖显式3D人脸模型的情况下,实现单图像神经对话头模型的自由视角合成?
  • RQ2无监督3D关键点表征能否有效解耦身份与运动信息,以实现高保真度视频合成?
  • RQ3所提出的3D关键点表征在视频会议中能将带宽降低多少,同时保持视觉质量?
  • RQ4自适应关键点与残差编码方案在不同网络条件下的带宽效率如何提升?
  • RQ5该方法能否在显著更低码率下实现与H.264在CRF 36下相当的视觉质量,特别是在实时会议场景中?

主要发现

  • 所提方法在基准数据集上实现与H.264在CRF 36下相当的视觉质量,同时带宽使用量降低10倍。
  • 通过在关键点表征上应用3D变换,模型实现了局部自由视角合成,支持头部旋转与新视角渲染。
  • 自适应关键点方案将每帧元数据大小降低至53.03字节(每像素0.001618比特),实现高效的带宽传输。
  • 残差的二值化编码平均仅需13.40 KB/次更新,显著降低了源图像质量下降时的重传开销。
  • MTurk上的用户研究表明,该方法在CRF 36下优于H.264,在CRF 37下优于H.265,表明其在更低码率下具有等效或更优的主观质量。
  • 在基准数据集上的视频重建、运动迁移与人脸重定向任务中,该方法优于当前最先进的单图像对话头视频合成模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。