Skip to main content
QUICK REVIEW

[论文解读] Face Parsing with RoI Tanh-Warping

Jinpeng Lin, Hao Yang|arXiv (Cornell University)|Jun 4, 2019
Face recognition and analysis参考文献 35被引用 6
一句话总结

本文提出了一种新颖的RoI Tanh-warping算子和一种混合CNN架构用于人脸分割,联合分割面部内部组件(眼睛、眉毛、鼻子、嘴巴)和头发区域。通过结合中心视觉(聚焦于面部部件)与周边视觉(提供头发的上下文信息),该方法提升了分割精度,尤其在难以预测的头发区域表现更优,在HELEN和LFW-PL基准上实现了端到端训练与每张人脸40ms高效推理的最先进性能。

ABSTRACT

Face parsing computes pixel-wise label maps for different semantic components (e.g., hair, mouth, eyes) from face images. Existing face parsing literature have illustrated significant advantages by focusing on individual regions of interest (RoIs) for faces and facial components. However, the traditional crop-and-resize focusing mechanism ignores all contextual area outside the RoIs, and thus is not suitable when the component area is unpredictable, e.g. hair. Inspired by the physiological vision system of human, we propose a novel RoI Tanh-warping operator that combines the central vision and the peripheral vision together. It addresses the dilemma between a limited sized RoI for focusing and an unpredictable area of surrounding context for peripheral information. To this end, we propose a novel hybrid convolutional neural network for face parsing. It uses hierarchical local based method for inner facial components and global methods for outer facial components. The whole framework is simple and principled, and can be trained end-to-end. To facilitate future research of face parsing, we also manually relabel the training data of the HELEN dataset and will make it public. Experiments on both HELEN and LFW-PL benchmarks demonstrate that our method surpasses state-of-the-art methods.

研究动机与目标

  • 为解决在人脸分割中准确分割面部内部组件与头发的挑战,传统裁剪与缩放方法因丢失周边上下文而失效。
  • 克服固定尺寸RoI裁剪的局限性,后者无法捕捉超出面部边界的不可预测头发区域。
  • 开发一种统一的、可端到端训练的框架,利用面部组件与周围上下文之间的空间关系。
  • 通过人工重新标注HELEN训练集,提升数据集质量,尤其增强头发标注的准确性。

提出的方法

  • 提出一种RoI Tanh-warping算子,非线性地将整幅图像映射为固定尺寸输出,强调中心面部区域的同时保留周边上下文。
  • 将经过变形的图像输入混合网络:一个类似Mask R-CNN的分支,使用RoI Align提取区域特定特征,用于内部组件分割。
  • 采用全卷积网络(FCN)分支,用于预测外部组件(包括头发和背景)的分割掩码。
  • 为每个内部面部组件使用独立的、非共享的分割头,以保留任务特定特征,提升精度。
  • 将网络与去变形步骤集成,将预测的掩码映射回原始图像空间,实现精确的实例级分割。
  • 使用交叉熵损失与Dice损失联合端到端训练模型,结合HELEN数据集上的数据增强与标签优化。

实验结果

研究问题

  • RQ1统一的深度学习框架能否有效处理紧密定位的面部组件与全局扩展的头发区域的联合分割?
  • RQ2通过非线性变形操作引入周边上下文信息,相比标准裁剪方法,能否显著提升分割性能?
  • RQ3结合RoI-based与全卷积分支的混合架构,在人脸分割任务中是否显著优于纯FCN或R-CNN架构?
  • RQ4为内部组件使用非共享分割头是否优于参数共享,从而带来性能提升?
  • RQ5该方法在真实图像中面对姿态变化、遮挡以及多张紧密排列人脸的情况时,鲁棒性如何?

主要发现

  • 所提方法在HELEN与LFW-PL基准上达到最先进性能,F-measure与整体准确率均超越先前方法。
  • RoI Tanh-warping将头发分割F-measure提升至88.8,优于标准裁剪(85.0)与更大裁剪区域(83.8–84.5)。
  • 混合架构整体F-measure达93.1,显著高于纯FCN(89.4)与Mask R-CNN(84.9)基线模型。
  • 为内部组件使用独立分割头(93.1)优于共享头(92.7),证实了任务特定特征学习的优势。
  • 模型在真实场景下泛化能力出色,能成功区分多张人脸,并有效应对姿态、表情与遮挡变化。
  • 该方法在Titan Xp GPU上推理速度达每张人脸40ms,展现出适用于实时应用的高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。