Skip to main content
QUICK REVIEW

[论文解读] Merge or Not? Learning to Group Faces via Imitation Learning

Yue He, Kaidi Cao|arXiv (Cornell University)|Jul 13, 2017
Face recognition and analysis参考文献 39被引用 4
一句话总结

本文提出了一种新颖的人脸分组框架,通过逆强化学习的模仿学习方法进行序列合并决策,在存在侧脸、噪声和无趣人脸的真实场景中提升了聚类性能。该方法在三个基准数据集上取得了最先进结果,包括一个全新的大规模数据集(GFW),通过从专家演示中学习短期和长期奖励。

ABSTRACT

Given a large number of unlabeled face images, face grouping aims at clustering the images into individual identities present in the data. This task remains a challenging problem despite the remarkable capability of deep learning approaches in learning face representation. In particular, grouping results can still be egregious given profile faces and a large number of uninteresting faces and noisy detections. Often, a user needs to correct the erroneous grouping manually. In this study, we formulate a novel face grouping framework that learns clustering strategy from ground-truth simulated behavior. This is achieved through imitation learning (a.k.a apprenticeship learning or learning by watching) via inverse reinforcement learning (IRL). In contrast to existing clustering approaches that group instances by similarity, our framework makes sequential decision to dynamically decide when to merge two face instances/groups driven by short- and long-term rewards. Extensive experiments on three benchmark datasets show that our framework outperforms unsupervised and supervised baselines.

研究动机与目标

  • 解决在存在侧脸、噪声检测和无趣人脸的真实世界场景中的人脸分组挑战,这些因素会降低现有深度度量学习方法的性能。
  • 克服传统聚类方法的局限性,后者仅基于相似性做出静态决策,未考虑序列上下文或操作成本。
  • 将人脸分组建模为序列决策问题,其中合并动作由即时(短期)和累积(长期)奖励共同指导。
  • 使用逆强化学习从专家演示中学习奖励函数,以处理复杂的真实世界数据分布,而无需手动设计奖励函数。
  • 引入一个大规模、逼真的基准数据集——野外人脸分组(GFW),用于在非受限条件下评估开放世界人脸分组。

提出的方法

  • 将人脸分组建模为马尔可夫决策过程(MDP),其中每个状态表示当前的人脸分组划分,动作为“合并”或“不合并”一对分组。
  • 使用逆强化学习(IRL)从专家演示(真实分组)中推断奖励函数,使智能体能够模仿最优行为,而无需预定义的奖励塑造。
  • 设计复合奖励函数,结合短期奖励(基于候选聚类的相似性、一致性和质量)和长期奖励(基于达到真实分组的操作成本)。
  • 集成基于聚类的推荐器(如层次聚类)以高效选择候选分组对进行合并,从而在保持性能的同时降低计算成本。
  • 训练智能体以优化合并决策的策略,使用学习到的奖励函数,实现对未见过的照片相册的泛化能力。
  • 使用深度度量嵌入(如在MS-Celeb-1M上微调的Inception-v3)作为人脸对的特征表示,并将人脸质量作为状态向量的输入特征。

实验结果

研究问题

  • RQ1通过逆强化学习的模仿学习能否有效学习到一种鲁棒的人脸分组策略,使其在包含侧脸和噪声人脸的多样化真实世界照片相册中具有泛化能力?
  • RQ2短期和长期奖励联合使用与仅使用单一类型奖励相比,如何共同提升分组性能?
  • RQ3在包含低质量或无趣人脸的数据集中,引入人脸质量与上下文线索在多大程度上能提升性能?
  • RQ4推荐器的选择(如层次聚类与随机选择)如何影响最终分组的效率和准确性?
  • RQ5学习到的策略能否在开放世界人脸分组任务中超越无监督和有监督基线方法,特别是在像GFW这样的新且逼真的基准数据集上?

主要发现

  • 所提出的IL-HC框架在LFW-Album上的F₁得分为91.1%,显著优于无监督基线方法和现有有监督方法。
  • 在新提出的GFW数据集上,该方法的F₁得分为67.3%,远高于无监督基线的15%和随机推荐器的61.9%。
  • 若移除长期奖励(操作成本),GFW上的F₁得分从67.3%降至62.6%,表明长期成本建模对于处理噪声和困难样本至关重要。
  • 若移除短期奖励并替换为简单的±1损失,GFW上的F₁得分降至17.1%,表明IRL学习到的奖励比启发式监督更有效。
  • 消融实验证实,人脸质量特征对GFW至关重要(无此特征时F₁从67.3%降至48.4%),但在更清晰的数据集如LFW-Album上影响较小。
  • 调整长期奖励中的成本分布可使算法偏向更高精确率或更高召回率,从而根据不同应用需求进行定制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。