[论文解读] Masked Face Recognition: Human vs. Machine
本研究对人类专家与最先进的自动人脸识别(FR)系统在遮掩面部验证任务中的表现进行了联合评估,结果表明,两者均受到口罩的类似影响,真实分数向伪造分数范围偏移。研究发现,合成口罩在评估中无法有效替代真实口罩,同时揭示了在佩戴口罩条件下,人类与机器性能之间存在强烈相关性。
The recent COVID-19 pandemic has increased the focus on hygienic and contactless identity verification methods. However, the pandemic led to the wide use of face masks, essential to keep the pandemic under control. The effect of wearing a mask on face recognition (FR) in a collaborative environment is a currently sensitive yet understudied issue. Recent reports have tackled this by evaluating the masked probe effect on the performance of automatic FR solutions. However, such solutions can fail in certain processes, leading to performing the verification task by a human expert. This work provides a joint evaluation and in-depth analyses of the face verification performance of human experts in comparison to state-of-the-art automatic FR solutions. This involves an extensive evaluation by human experts and 4 automatic recognition solutions. The study concludes with a set of take-home messages on different aspects of the correlation between the verification behavior of humans and machines.
研究动机与目标
- 调查口罩对人类专家在身份验证任务中面部验证表现的影响。
- 比较人类专家与最先进的自动FR系统在佩戴口罩条件下的验证性能。
- 评估合成口罩与真实口罩在基准化遮掩面部识别系统中的有效性。
- 分析面部裁剪宽度(包括发型和面部边界)对人类在佩戴口罩时验证准确率的影响。
- 为改善现实世界系统中的遮掩面部验证提供可操作的见解,特别是在后疫情时代身份验证工作流中。
提出的方法
- 组织了一项广泛的实验评估,12名人类专家对佩戴和未佩戴口罩的面部配对执行面部验证。
- 在相同数据集上评估了四种自动FR系统,包括一款性能顶尖的商用现成(COTS)解决方案。
- 使用真实口罩(来自实际疫情使用)和合成生成的口罩,评估其对验证性能的影响。
- 通过真实分数与伪造分数分布、等错误率(EER)以及可分性度量来衡量验证性能。
- 改变面部裁剪区域,以评估非面部特征(如发型、额头)对验证准确率的贡献。
- 收集人类专家的定性反馈,以关联行为观察与定量性能趋势。
实验结果
研究问题
- RQ1与自动FR系统相比,口罩对人类专家验证性能的影响如何?
- RQ2合成口罩在评估人类与机器验证性能时,能在多大程度上准确代表真实口罩?
- RQ3使用佩戴口罩的参考图像是否能提升人类或机器的验证性能?
- RQ4面部边界和非面部特征(如发型)的可见性如何影响人类在佩戴口罩时的验证准确率?
- RQ5人类专家的定性观察与遮掩面部验证中的统计性能趋势之间存在何种相关性?
主要发现
- 人类专家在验证佩戴口罩的探测图像时性能显著下降,其表现与自动FR系统所见的退化相似,尤其体现在真实分数向伪造分数范围偏移。
- 当面部裁剪区域更宽、包含发型等非面部特征时,人类专家的验证性能有所提升,尽管在长期验证场景中实用性较低。
- 合成口罩在性能评估中并非真实口罩的可靠替代品,因其无法复现现实世界中反射、阴影和口罩设计的差异。
- 相较于佩戴口罩与未佩戴口罩的对比,佩戴口罩与佩戴口罩的配对会导致真实分数与伪造分数均发生偏移,而后者主要影响真实分数。
- 使用佩戴口罩的参考图像仅在不一致的情况下提升验证性能;然而,合成佩戴口罩的参考图像显示出更稳定的性能提升,可能归因于其一致的视觉外观。
- 人类专家的定性反馈与定量性能指标之间存在强烈相关性,表明通过针对性训练可实现性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。