[论文解读] EgoFace: Egocentric Face Performance Capture and Videorealistic Reenactment
EgoFace 提出了一种轻量级、实时的系统,用于从佩戴在眼镜上的单个鱼眼镜头摄像头实现第一人称视角的面部动作捕捉与视频级真实感重演。它通过一个卷积神经网络(Ego2Exp)从高度失真、单侧视角中估计面部表情,再利用对抗性训练的生成对抗网络(Exp2VRealFace)生成正面、逼真的视频,实现了在不同光照、背景和运动条件下高保真度的结果,且无需人工标注或可穿戴设备。
Face performance capture and reenactment techniques use multiple cameras and sensors, positioned at a distance from the face or mounted on heavy wearable devices. This limits their applications in mobile and outdoor environments. We present EgoFace, a radically new lightweight setup for face performance capture and front-view videorealistic reenactment using a single egocentric RGB camera. Our lightweight setup allows operations in uncontrolled environments, and lends itself to telepresence applications such as video-conferencing from dynamic environments. The input image is projected into a low dimensional latent space of the facial expression parameters. Through careful adversarial training of the parameter-space synthetic rendering, a videorealistic animation is produced. Our problem is challenging as the human visual system is sensitive to the smallest face irregularities that could occur in the final results. This sensitivity is even stronger for video results. Our solution is trained in a pre-processing stage, through a supervised manner without manual annotations. EgoFace captures a wide variety of facial expressions, including mouth movements and asymmetrical expressions. It works under varying illuminations, background, movements, handles people from different ethnicities and can operate in real time.
研究动机与目标
- 使用单个 RGB 摄像头,在动态、非受控环境中实现移动式、无感的面部动作捕捉。
- 解决从高度失真、单侧第一人称视角中重建准确面部表情的挑战。
- 从第一人称输入生成逼真、正面视角的视频重演,无需多摄像头设置或可穿戴设备。
- 实现实时性能,适用于远程呈现和视频会议应用。
- 开发一个可泛化至不同种族、光照和动作的基准数据集与训练流程。
提出的方法
- 基于卷积神经网络的 Ego2Exp 网络,将单个第一人称 RGB 图像映射到低维潜在空间中的面部表情参数,采用监督方式训练,无需人工标注。
- 条件生成对抗网络 Exp2VRealFace 通过对抗训练将重建的 3D 面部模型转换为逼真正面视频,以保持面部完整性和真实感。
- 系统使用参数化面部模型并进行身份特定训练,以在不同表情和视角下保持主体一致性。
- 使用面部模型的合成渲染图像作为 Exp2VRealFace 的训练目标,实现从第一人称视角到正面视角的无配对图像翻译。
- 通过减少网络深度、降低输入分辨率并移除时序建模,优化推理速度,实现在每帧 36.2 ms 内运行,支持实时处理。
- 为提高效率,特别是适用于移动远程呈现,对输入和输出均采用紧密面部裁剪并降低至 128×128 分辨率。
实验结果
研究问题
- RQ1仅使用佩戴在眼镜上的单个高度失真的第一人称摄像头,能否实现与多摄像头系统相当的面部表情估计精度?
- RQ2对抗性训练能否在无人工监督的情况下,从单侧、斜向视角生成逼真、正面的面部重演视频?
- RQ3该系统在不同光照条件、背景和面部表情(包括不对称和复杂嘴部动作)下的泛化能力如何?
- RQ4整个处理流程能否在消费级硬件上实现实时运行,适用于远程呈现和视频会议?
- RQ5与无配对图像翻译方法(如 CycleGAN 和 UNIT)相比,该系统在保留面部结构和表情保真度方面是否表现更优?
主要发现
- 当仅使用单个斜向第一人称视角时,EgoFace 在面部几何估计精度上与最先进正面视角方法相当(平均误差 1.7 mm)。
- 经过对抗训练的 Exp2VRealFace 网络生成了逼真、正面的面部重演视频,成功保留了面部身份与表情,优于 CycleGAN 和 UNIT,后者导致了不自然的面部形变。
- 经过优化的 EgoFace 处理流程使用 ResNet50 和轻量化 Exp2VRealFace,每帧处理时间仅为 36.2 ms,支持实时运行,适用于远程呈现。
- 将 Ego2Exp 中的 VGG 主干网络替换为 ResNet50 后,推理时间减少 54%(从 26.4 ms 降至 11.5 ms),且精度损失可忽略。
- Exp2VRealFace 的完整版与优化版在自重演任务上的均方误差(MSE)无显著差异,证实优化未降低视觉质量。
- 该系统在不同种族、可变光照、复杂表情和动态背景条件下均表现稳定,未出现性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。