Skip to main content
QUICK REVIEW

[论文解读] Real-Time Facial Segmentation and Performance Capture from RGB Input

Shunsuke Saito, Tianye Li|arXiv (Cornell University)|Apr 10, 2016
Face recognition and analysis参考文献 19被引用 22
一句话总结

本文提出了一种基于RGB的实时面部分割与表演捕捉系统,采用具有共享卷积特征的双流反卷积神经网络,在极端遮挡条件下实现了精确且鲁棒的面部分割。通过在包含合成手部遮挡和非面部区域掩码的增强数据集上进行训练,该方法在30 fps下实现了最先进的3D面部追踪性能,即使在完整手部接触面部的动作或侧视情况下也表现出色,显著提升了以往仅使用RGB输入方法的鲁棒性。

ABSTRACT

We introduce the concept of unconstrained real-time 3D facial performance capture through explicit semantic segmentation in the RGB input. To ensure robustness, cutting edge supervised learning approaches rely on large training datasets of face images captured in the wild. While impressive tracking quality has been demonstrated for faces that are largely visible, any occlusion due to hair, accessories, or hand-to-face gestures would result in significant visual artifacts and loss of tracking accuracy. The modeling of occlusions has been mostly avoided due to its immense space of appearance variability. To address this curse of high dimensionality, we perform tracking in unconstrained images assuming non-face regions can be fully masked out. Along with recent breakthroughs in deep learning, we demonstrate that pixel-level facial segmentation is possible in real-time by repurposing convolutional neural networks designed originally for general semantic segmentation. We develop an efficient architecture based on a two-stream deconvolution network with complementary characteristics, and introduce carefully designed training samples and data augmentation strategies for improved segmentation accuracy and robustness. We adopt a state-of-the-art regression-based facial tracking framework with segmented face images as training, and demonstrate accurate and uninterrupted facial performance capture in the presence of extreme occlusion and even side views. Furthermore, the resulting segmentation can be directly used to composite partial 3D face models on the input images and enable seamless facial manipulation tasks, such as virtual make-up or face replacement.

研究动机与目标

  • 在严重遮挡条件下,实现从非约束性RGB输入中实时、鲁棒的3D面部表演捕捉。
  • 解决由头发、手部和配饰等引起的高维外观变化带来的挑战。
  • 通过显式分割面部区域并在掩码面部数据上训练3D回归器,提升追踪精度。
  • 开发一种数据增强策略,包含合成遮挡和负样本,以增强泛化能力。
  • 证明语义分割可降低面部建模的维度,从而实现更稳定、更精确的回归。

提出的方法

  • 采用具有共享低层卷积特征的双流反卷积网络,同时预测粗略的面部形状和精细的边界细节。
  • 网络输出概率图,经图割算法优化后生成精确的分割掩码。
  • 该方法利用预训练的ImageNet特征,并在LFW和FaceWarehouse数据集上进行微调,使用精心设计的训练样本。
  • 提出一种新颖的数据增强策略,包括扰动、随机裁剪、合成遮挡(如手部)以及无面部的负样本。
  • 最终的分割掩码用于隔离面部区域,随后输入到最先进的基于DDE的3D面部追踪框架中。
  • 系统在30 fps下实时运行,分割与追踪阶段在GPU和CPU上并行处理。

实验结果

研究问题

  • RQ1从非约束性RGB输入中实现像素级实时面部分割,是否能显著提升在遮挡条件下的3D面部表演捕捉鲁棒性?
  • RQ2具有共享卷积特征的双流反卷积架构在捕捉面部分割中的全局形状与精细边界细节方面,效果如何?
  • RQ3在数据量有限的情况下,合成遮挡数据与负样本在多大程度上能提升面部分割的泛化能力?
  • RQ4与未掩码训练相比,基于深度分割生成的掩码训练数据是否能显著提升在极端遮挡条件下的3D面部回归性能?
  • RQ5显式语义分割是否能降低3D人脸拟合问题的有效维度,从而实现更稳定、更精确的追踪?

主要发现

  • 所提方法仅使用RGB输入,即在30 fps下实现实时性能捕捉,追踪与分割在CPU和GPU上并行处理。
  • 系统在完整手部接触面部的动作中仍能保持精确追踪,即使手部与面部肤色相近,也优于以往的仅使用RGB的方法。
  • 在数据增强中引入合成遮挡与负样本,显著提升了在有限真实分割数据上的泛化能力,并减少了过拟合。
  • 具有共享卷积特征的双流反卷积架构在面部分割精度上达到当前最先进水平,尤其在保持精细边界细节方面表现优异。
  • 尽管仅依赖RGB输入,该方法在遮挡处理能力上与近期基于RGB-D的方法[7]相当。
  • 生成的分割掩码可实现头发和手部等遮挡物下的3D人脸模型无缝合成,支持虚拟化妆与人脸替换等应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。