[论文解读] Dependency-aware Attention Control for Unconstrained Face Recognition with Image Sets
本文提出依赖感知注意力控制(DAC),一种深度强化学习框架,用于在无序图像集中建模图像间依赖关系,实现无约束人脸识别。通过将注意力分配建模为基于演员-评论家强化学习的马尔可夫决策过程,DAC 根据图像间的上下文关系自适应地加权图像,在 YTF 和 Celebrity-1000 基准测试中超越了最先进方法,且无需额外监督。
This paper targets the problem of image set-based face verification and identification. Unlike traditional single media (an image or video) setting, we encounter a set of heterogeneous contents containing orderless images and videos. The importance of each image is usually considered either equal or based on their independent quality assessment. How to model the relationship of orderless images within a set remains a challenge. We address this problem by formulating it as a Markov Decision Process (MDP) in the latent space. Specifically, we first present a dependency-aware attention control (DAC) network, which resorts to actor-critic reinforcement learning for sequential attention decision of each image embedding to fully exploit the rich correlation cues among the unordered images. Moreover, we introduce its sample-efficient variant with off-policy experience replay to speed up the learning process. The pose-guided representation scheme can further boost the performance at the extremes of the pose variation.
研究动机与目标
- 解决在无序、异构图像集中建模图像间关系的挑战,其中传统方法假设图像重要性相等或相互独立。
- 克服先前方法仅基于单个图像质量分配权重的局限性,避免冗余并保留多样但质量较低但具有信息量的视角。
- 开发一种通用的注意力机制,利用组内依赖关系与组间关系,提升在无约束人脸识别与验证任务中的鲁棒性。
- 实现仅使用集合级别身份监督的端到端训练,避免对额外标注或复杂数据管道的需求。
- 通过姿态引导表示方案与离策略经验回放,平衡计算效率与信息利用率。
提出的方法
- 将图像集注意力问题建模为潜在空间中的马尔可夫决策过程(MDP),其中图像按顺序处理,动作选择依赖于当前状态。
- 设计一种使用演员-评论家深度强化学习的 DAC 网络,学习一种策略,根据先前处理图像的上下文决定每张图像的注意力权重。
- 提出一种样本高效的 DAC 变体,利用离策略经验回放以加速训练并提升数据效率。
- 引入姿态引导表示(PGR)方案与随机路由机制,以建模组间依赖关系,增强对姿态变化的鲁棒性。
- 仅使用集合级别身份标签端到端训练整个系统,实现特征提取与注意力控制的联合优化。
- 使用奖励网络在训练过程中提供密集监督,促使模型生成紧凑且具有判别性的集合级表示。
实验结果
研究问题
- RQ1强化学习能否有效应用于无序图像集中建模图像间依赖关系以实现人脸识别?
- RQ2基于图像间上下文关系学习注意力权重是否优于独立分配或基于质量的加权策略?
- RQ3能否仅使用集合级别监督,无需图像级别标注,实现深度演员-评论家框架的端到端训练?
- RQ4在 YTF 和 IJB-A 等具有挑战性的基准测试中,所提出的 DAC 方法在准确率与鲁棒性方面与最先进方法相比如何?
- RQ5姿态引导表示方案在极端姿态变化下能多大程度上提升性能?
主要发现
- 在 YTF 数据集上,DAC 实现了 95.97% ± 0.0041 的验证准确率,超越了包括 FaceNet 和 NAN 在内的最先进方法,即使未微调 CNN 主干网络。
- 在 Celebrity-1000 数据集上,DAC 在闭集识别中实现 91.37% 的 rank-1 准确率,在开集识别中实现 82.64% 的准确率,优于所有基线方法,包括 NAN 和 MTJSR。
- DAC(off) 变体(使用离策略经验回放)性能略优于 DAC(on),表明其样本效率与训练稳定性更优。
- 消融实验表明,DAC 通过降低低质量、外观相似图像的权重,有效减少了冗余,同时保留了如侧脸等具有信息量的视角。
- 姿态引导表示方案显著提升了在极端姿态变化下的性能,证明其在应对具有挑战性的现实条件中的有效性。
- 该方法在不同数据集间泛化良好,可轻松集成至先进的 CNN 架构中,表明其在人脸识别之外具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。