Skip to main content
QUICK REVIEW

[论文解读] Face Parsing via Recurrent Propagation

Sifei Liu, Jianping Shi|arXiv (Cornell University)|Aug 6, 2017
Face recognition and analysis参考文献 25被引用 8
一句话总结

本文提出了一种轻量级人脸分割框架,结合浅层卷积神经网络(CNN)与空间可变循环神经网络(RNN),实现高效、精确的像素级分割。RNN 通过语义边缘引导实现全局标签传播,在单张 GPU 上实现 300 FPS 的实时性能,同时在准确率和效率方面优于当前最先进方法,尤其在细粒度人脸组件的分割上表现优异,得益于两阶段方法。

ABSTRACT

Face parsing is an important problem in computer vision that finds numerous applications including recognition and editing. Recently, deep convolutional neural networks (CNNs) have been applied to image parsing and segmentation with the state-of-the-art performance. In this paper, we propose a face parsing algorithm that combines hierarchical representations learned by a CNN, and accurate label propagations achieved by a spatially variant recurrent neural network (RNN). The RNN-based propagation approach enables efficient inference over a global space with the guidance of semantic edges generated by a local convolutional model. Since the convolutional architecture can be shallow and the spatial RNN can have few parameters, the framework is much faster and more light-weighted than the state-of-the-art CNNs for the same task. We apply the proposed model to coarse-grained and fine-grained face parsing. For fine-grained face parsing, we develop a two-stage approach by first identifying the main regions and then segmenting the detail components, which achieves better performance in terms of accuracy and efficiency. With a single GPU, the proposed algorithm parses face images accurately at 300 frames per second, which facilitates real-time applications.

研究动机与目标

  • 解决基于深度 CNN 的人脸分割方法计算成本高、内存需求大的问题。
  • 在不损失准确率的前提下,实现人脸分割的实时推理。
  • 提升对标准模型中表征不足的小型、细粒度人脸组件(如眼睛、眉毛)的分割性能。
  • 在保持高分割准确率的同时,降低模型复杂度与参数量。
  • 开发一种高效的两阶段框架,通过局部化、平衡学习显著提升对细节人脸部位的分割性能。

提出的方法

  • 使用浅层 CNN 提取局部特征并生成语义边缘图,以指导标签传播。
  • 引入空间可变 RNN,其中循环门根据局部一致性动态控制传播强度,实现在极少数参数下的全局推理。
  • RNN 模块在图像中传播预测标签,利用标签一致区域中的冗余空间信息。
  • 针对细粒度分割,采用两阶段方法:首先使用完整网络分割主要人脸区域;其次,通过轻量级子网络处理裁剪后的人脸子区域,以提升小部件的准确性。
  • 空间可变门通过浅层 CNN 的低级和中级特征端到端学习,并作为条件输入。
  • 整个框架端到端训练,推理速度在单张 GPU 上达到 300 FPS,支持 11 类分割。

实验结果

研究问题

  • RQ1能否设计一种轻量级、实时的人脸分割模型,在降低计算成本的同时保持高准确率?
  • RQ2与标准 RNN 或 CRF 后处理相比,空间可变循环传播在提升全局标签一致性方面有多高效?
  • RQ3与单一统一模型相比,两阶段网络架构是否能显著提升对小型、细粒度人脸组件的分割准确率?
  • RQ4在第二阶段使用裁剪子区域在多大程度上提升了对细节人脸部位的学习效率与准确率?
  • RQ5与当前最先进基于 CNN 的人脸分割网络相比,所提方法在速度和准确率方面表现如何?

主要发现

  • 所提 RNN-G 模型在 HELEN 数据集上达到 88.6% 的总体 F-measure,相比先前最先进方法误差率降低 20%。
  • 两阶段方法显著提升了对细粒度组件的性能,眼睛 F-measure 达 86.8%,眉毛达 77.0%,显著优于单阶段模型(分别为 63.3% 和 53.7%)。
  • 该模型在单张 GPU 上以 300 FPS 的速度处理人脸图像进行 11 类分割,支持实时应用。
  • 采用可学习门控的空间可变 RNN 显著优于标准 RNN 和基线 CNN,证明了引导式、自适应传播的有效性。
  • 两阶段方法降低了整体网络复杂度,并通过在裁剪区域中平衡像素分布,提升了对小型人脸组件的性能。
  • 该框架比基于深度 CNN 的人脸分割模型快 100–300 倍,且显著更小,同时保持相近的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。