Skip to main content
QUICK REVIEW

[论文解读] Multi-Prototype Networks for Unconstrained Set-based Face Recognition

Jian Zhao, Jianshu Li|arXiv (Cornell University)|Feb 13, 2019
Face recognition and analysis参考文献 48被引用 6
一句话总结

该论文提出多原型网络(MPNet),一种端到端可训练的模型,通过从非约束图像和视频集合中学习多个判别性人脸原型,以解决真实世界人脸识别中高内部集合方差的问题。利用密集子图(DSG)学习子网络,MPNet隐式地将媒体集合划分为紧凑的、与条件相关的原型,显著提升了在IJB-A、YTF和IJB-C基准上的基于集合的识别准确率,超越了当前最先进方法。

ABSTRACT

In this paper, we study the challenging unconstrained set-based face recognition problem where each subject face is instantiated by a set of media (images and videos) instead of a single image. Naively aggregating information from all the media within a set would suffer from the large intra-set variance caused by heterogeneous factors (e.g., varying media modalities, poses and illuminations) and fail to learn discriminative face representations. A novel Multi-Prototype Network (MPNet) model is thus proposed to learn multiple prototype face representations adaptively from the media sets. Each learned prototype is representative for the subject face under certain condition in terms of pose, illumination and media modality. Instead of handcrafting the set partition for prototype learning, MPNet introduces a Dense SubGraph (DSG) learning sub-net that implicitly untangles inconsistent media and learns a number of representative prototypes. Qualitative and quantitative experiments clearly demonstrate superiority of the proposed model over state-of-the-arts.

研究动机与目标

  • 解决由于姿态、光照和媒体模态变化导致的非约束集合人脸识别中高内部集合方差的挑战。
  • 克服现有方法依赖手工设计集合划分或简单池化(如平均/最大池化)进行集合级表征的局限性。
  • 开发一种端到端可训练的框架,自适应地学习每个主体的多个判别性原型,而无需对集合结构做先验假设。
  • 通过在多样化条件下建模主体特定表征,提升真实世界人脸识别的鲁棒性和准确性。
  • 通过学习紧凑的、与条件相关的原型,实现有效的集合到集合匹配,以捕捉显著的面部特征。

提出的方法

  • 提出多原型网络(MPNet),从混合图像和视频集合中学习每个主体的多个原型表征。
  • 引入密集子图(DSG)学习子网络,基于相似性隐式地将每个媒体集合划分为解耦的子集,而无需手工设计聚类。
  • 利用DSG子网络学习在每个子集中紧凑、跨不同主体具有判别性的原型。
  • 端到端训练模型以增强原型的紧凑性和覆盖度,有效解耦姿态、光照和模态等异质属性。
  • 通过学习到的原型进行特征聚合,而非使用简单的池化方法,以保留集合级匹配的关键信息。
  • 采用对比损失优化原型的判别性,确保其代表不同的面部条件,同时保持集合内的一致性。

实验结果

研究问题

  • RQ1深度学习模型能否在不进行显式集合划分的情况下,从非约束媒体集合中学习到多个、与条件相关的面部原型?
  • RQ2与单原型或简单池化方法相比,端到端学习多个原型在识别准确率方面有何提升?
  • RQ3基于DSG的子网络在多大程度上能隐式解耦不一致的媒体,并在高方差环境下提升表征质量?
  • RQ4MPNet在具有不同姿态、光照和媒体类型非约束变化程度的多样化基准上是否具备泛化能力?
  • RQ5所提出的框架能否在具有挑战性的、真实世界的基于集合的人脸识别场景中超越当前最先进方法?

主要发现

  • 在IJB-A基准上,MPNet在所有对比方法中实现了最高的验证性能,显著领先于第二名方法。
  • 在YTF基准上,MPNet将第二名结果的验证准确率提升了1.10%,证明其在基于视频识别任务中的强大泛化能力。
  • 在IJB-C基准上,MPNet在FAR=10^-5时达到TAR=0.827,领先第二名方法5.60个百分点,证实其对极端变化的鲁棒性。
  • 可视化结果表明,学习到的原型对应于不同的面部条件(如特定姿态或光照),证实了模型解耦异质属性的能力。
  • 消融研究证实DSG子网络对性能至关重要,移除后准确率显著下降,验证了其在隐式集合划分中的作用。
  • 该模型在计算复杂度低于穷举成对匹配方法的前提下实现了更优性能,使其在真实世界部署中更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。