Skip to main content
QUICK REVIEW

[论文解读] CASIA-SURF CeFA: A Benchmark for Multi-modal Cross-ethnicity Face Anti-spoofing

Ajian Li, Zichang Tan|arXiv (Cornell University)|Mar 11, 2020
Biometric Identification and Security参考文献 42被引用 7
一句话总结

本论文提出了CeFA,这是目前公开可用的最大的面部反欺骗数据集,涵盖三种族裔(非洲、东亚、中亚)、四种攻击类型(2D/3D打印、重放攻击、硅胶凝胶)以及三种模态(RGB、深度、红外),并带有明确的族裔标签。论文提出了一种部分共享的多模态网络(PSMM-Net),采用每模态的静态-动态融合机制,在CeFA、OULU-NPU、SiW和CASIA-SURF上均取得了最先进性能,展现出对跨族裔及未知欺骗攻击的更强鲁棒性。

ABSTRACT

Ethnic bias has proven to negatively affect the performance of face recognition systems, and it remains an open research problem in face anti-spoofing. In order to study the ethnic bias for face anti-spoofing, we introduce the largest up to date CASIA-SURF Cross-ethnicity Face Anti-spoofing (CeFA) dataset (briefly named CeFA), covering $3$ ethnicities, $3$ modalities, $1,607$ subjects, and 2D plus 3D attack types. Four protocols are introduced to measure the affect under varied evaluation conditions, such as cross-ethnicity, unknown spoofs or both of them. To the best of our knowledge, CeFA is the first dataset including explicit ethnic labels in current published/released datasets for face anti-spoofing. Then, we propose a novel multi-modal fusion method as a strong baseline to alleviate these bias, namely, the static-dynamic fusion mechanism applied in each modality (i.e., RGB, Depth and infrared image). Later, a partially shared fusion strategy is proposed to learn complementary information from multiple modalities. Extensive experiments demonstrate that the proposed method achieves state-of-the-art results on the CASIA-SURF, OULU-NPU, SiW and the CeFA dataset.

研究动机与目标

  • 为解决公开可用的面部反欺骗数据集中缺乏明确族裔标签的问题,该问题阻碍了对反欺骗系统中族裔偏差的研究。
  • 建立一个全面的基准,用于评估面部反欺骗中跨族裔与未知欺骗泛化能力。
  • 开发一种强健的多模态融合基线模型,通过动态特征学习减轻族裔与攻击模式偏差。
  • 提供四种评估协议,系统性地衡量在跨族裔、未知欺骗或两者并存条件下的性能表现。
  • 在多个公开基准上验证所提数据集与方法的实用性,展示其改进的泛化能力与最先进性能。

提出的方法

  • 提出CASIA-SURF CeFA数据集,包含1,607名受试者,覆盖三种族裔、四种攻击类型(打印、重放、3D打印、硅胶凝胶)以及三种模态(RGB、深度、红外),在不同光照条件下采集。
  • 在每个模态分支中引入静态-动态融合机制,通过7帧序列的秩池化生成动态图像,以捕捉运动线索。
  • 设计一种部分共享的多模态网络(PSMM-Net),实现在保留模态特异性特征学习的同时,实现模态间的早期交互。
  • 采用双分支架构:一个用于静态图像特征,另一个用于动态图像特征,通过共享与非共享层的结合,平衡归纳偏差与特征互补性。
  • 使用秩池化将视频片段转换为动态图像,以突出真实与欺骗人脸之间的时序差异。
  • 应用四种评估协议,以评估跨族裔泛化能力、未知欺骗检测能力以及综合鲁棒性。

实验结果

研究问题

  • RQ1族裔背景在多大程度上影响面部反欺骗模型的性能,特别是在跨族裔设置下?
  • RQ2当前最先进反欺骗方法在不同族裔群体中对未知欺骗攻击的泛化能力如何?
  • RQ3结合动态特征学习的多模态融合是否能提升对族裔与欺骗变化的鲁棒性?
  • RQ4与现有方法相比,所提出的PSMM-Net基线在减少族裔与欺骗偏差方面效果如何?
  • RQ5在CeFA数据集上进行预训练是否能提升在其他公开基准(如SiW和OULU-NPU)上的性能?

主要发现

  • 所提出的SD-Net基线在CeFA的Protocol 1上达到1.0%的ACER,优于现有方法(包括BAS和STASN)。
  • 在CeFA的Protocol 2上,该方法实现1.1%的ACER,表明其在跨族裔评估下具有出色的泛化能力。
  • 在OULU-NPU的Protocol 3和Protocol 4上,该方法分别取得2.5%和2.6%的ACER,达到最先进水平,表明对未知欺骗攻击与跨族裔场景具有强鲁棒性。
  • 在SiW数据集上,该方法在Protocol 3和Protocol 4上分别实现1.8%和2.6%的ACER,优于BAS和STASN。
  • 在CeFA数据集上进行预训练显著提升了在SiW和OULU-NPU上的ACER表现,尤其在Protocol 2和Protocol 3上达到最佳结果。
  • 可视化结果表明,动态图像表示能有效捕捉运动与镜面反射差异,尤其在区分重放攻击与真实人脸方面表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。