Skip to main content
QUICK REVIEW

[论文解读] End-to-end semantic face segmentation with conditional random fields as convolutional, recurrent and adversarial networks

Umut Güçlü, Yağmur Güçlütürk|arXiv (Cornell University)|Mar 9, 2017
Face recognition and analysis参考文献 11被引用 18
一句话总结

本文提出了一种端到端可训练的语义人脸分割模型,将条件随机场(CRFs)与卷积网络、循环网络及生成对抗网络相结合。通过在四邻接CRF图上学习一元势和成对势,利用空洞卷积捕捉多尺度上下文信息,并通过对抗训练强化高阶一致性,该模型在Part Labels和Helen数据集上实现了最先进性能,显著提升了头发等困难部位的分割准确率。

ABSTRACT

Recent years have seen a sharp increase in the number of related yet distinct advances in semantic segmentation. Here, we tackle this problem by leveraging the respective strengths of these advances. That is, we formulate a conditional random field over a four-connected graph as end-to-end trainable convolutional and recurrent networks, and estimate them via an adversarial process. Importantly, our model learns not only unary potentials but also pairwise potentials, while aggregating multi-scale contexts and controlling higher-order inconsistencies. We evaluate our model on two standard benchmark datasets for semantic face segmentation, achieving state-of-the-art results on both of them.

研究动机与目标

  • 解决在光照、姿态、表情和发质等变化条件下进行语义人脸分割的挑战。
  • 将语义分割领域的最新进展——端到端训练、可学习CRF势函数、多尺度上下文信息、高阶一致性——统一整合到一个统一框架中。
  • 提升对困难面部部位(尤其是头发)的分割性能,这些部位常因与背景颜色相似及非刚性结构而被错误分类。
  • 通过利用人脸的结构特性,基于关键点进行条件化或训练针对特定部位的模型,以提高定位精度。
  • 在标准基准上实现最先进性能,同时保持端到端可微性,并对遮挡和杂乱场景具有鲁棒性。

提出的方法

  • 将条件随机场(CRF)构建在四邻接图上,形成一个端到端可微的架构,结合卷积神经网络与循环神经网络。
  • 通过可微的循环网络联合学习CRF的一元势和成对势,实现分割与CRF参数的联合优化。
  • 引入空洞卷积以扩大感受野,捕获多尺度上下文信息,同时保持分辨率不变。
  • 引入对抗训练以强化预测结果的高阶一致性,无需显式建模高阶势函数即可减少空间不一致性。
  • 基于人脸关键点对模型进行条件化,或为每个面部部位训练多个专用模型,以基于部件的方式融合输出,提升定位精度。
  • 使用基于GAN的判别器区分真实真实分割图与生成预测结果,以鼓励输出结果更加真实且一致。

实验结果

研究问题

  • RQ1是否能够通过统一的深度学习框架,在保持端到端可训练性的同时,联合优化CRF中的一元势和成对势用于语义人脸分割?
  • RQ2引入空洞卷积与对抗训练在多尺度上下文聚合与结构一致性方面对人脸分割有何提升作用?
  • RQ3基于人脸关键点进行条件化或训练针对特定部位的模型,在多细粒度面部组件分割中能将准确率提升到何种程度?
  • RQ4所提出的CnnRnnGan模型是否在Part Labels和Helen等标准基准上优于现有最先进方法?
  • RQ5该模型的失败模式是什么?其与视觉模糊性(如头发与背景颜色相似或极端面部表情)有何关联?

主要发现

  • 所提出的CnnRnnGan模型在Part Labels和Helen数据集上均实现了最先进性能,其平均Jaccard指数优于先前方法。
  • 在Helen数据集上,采用初始分割条件化多个特定部位的CnnRnnGan头(init.+5c.)的模型,实现了0.7873的平均Jaccard指数,显著优于基线变体。
  • 与简单基线相比,该模型在眉毛(+0.2132)、眼睛(+0.1936)和口腔内部(+0.1843)等困难部位的分割准确率显著提升。
  • 对抗训练有助于减少空间不一致性,定性结果表明预测结果更加平滑且一致,尤其在嘴部和鼻部等复杂区域表现更优。
  • 失败案例主要出现在头发颜色与背景相近,或面部表情明显偏离中性姿态时,表明模型在颜色和形状泛化方面仍存在局限。
  • 消融实验确认,结合初始分割条件化的多个特定部位模型,可在所有类别上实现最一致且最准确的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。