Skip to main content
QUICK REVIEW

[论文解读] Static and Dynamic Fusion for Multi-modal Cross-ethnicity Face Anti-spoofing

Ajian Liu, Zichang Tan|arXiv (Cornell University)|Dec 5, 2019
Biometric Identification and Security参考文献 36被引用 10
一句话总结

该论文提出了一种静态-动态融合网络(SD-Net)和一种部分共享多模态网络(PSMM-Net),用于跨种族的人脸活体检测,通过利用秩池化生成的动态图像与多模态融合来提升鲁棒性。该方法在CASIA-SURF CeFA、OULU-NPU、SiW和CASIA-SURF等多个基准数据集上实现了最先进性能,尤其在新基准数据集上的ACER低至0.35%。

ABSTRACT

Regardless of the usage of deep learning and handcrafted methods, the dynamic information from videos and the effect of cross-ethnicity are rarely considered in face anti-spoofing. In this work, we propose a static-dynamic fusion mechanism for multi-modal face anti-spoofing. Inspired by motion divergences between real and fake faces, we incorporate the dynamic image calculated by rank pooling with static information into a conventional neural network (CNN) for each modality (i.e., RGB, Depth and infrared (IR)). Then, we develop a partially shared fusion method to learn complementary information from multiple modalities. Furthermore, in order to study the generalization capability of the proposal in terms of cross-ethnicity attacks and unknown spoofs, we introduce the largest public cross-ethnicity Face Anti-spoofing (CASIA-CeFA) dataset, covering 3 ethnicities, 3 modalities, 1607 subjects, and 2D plus 3D attack types. Experiments demonstrate that the proposed method achieves state-of-the-art results on CASIA-CeFA, CASIA-SURF, OULU-NPU and SiW.

研究动机与目标

  • 解决现有面部活体检测方法中对动态时间信息和跨种族泛化能力考虑不足的问题。
  • 通过整合真实与伪造人脸之间的运动差异,克服手工设计特征与单模态深度学习方法的局限性。
  • 设计一种部分共享的多模态网络,以有效学习RGB、深度和红外模态之间的互补特征。
  • 引入目前最大的公开跨种族人脸活体检测数据集CASIA-SURF CeFA,涵盖三个种族的1607名受试者及四种攻击类型(2D/3D打印、重放攻击、硅胶)。

提出的方法

  • 提出SD-Net,通过秩池化从视频序列中生成动态图像,联合学习每种模态(RGB、深度、红外)的静态与动态特征。
  • 利用秩池化计算真实与伪造人脸之间的运动差异,捕捉时间动态特性,无需人工引导的运动线索。
  • 设计PSMM-Net,采用部分共享分支结构,实现模态特异性和共享特征学习,增强互补与相关特征的提取。
  • 在PSMM-Net中实施早期与晚期融合策略,实现在多个阶段上模态间的交互,提升特征表示能力。
  • 采用监督学习与迁移学习相结合的方式进行模型训练与评估,包括在CASIA-SURF CeFA上进行预训练。
  • 采用多阶段训练流程,结合交叉熵损失与度量学习,优化真实与伪造样本之间的判别能力。

实验结果

研究问题

  • RQ1通过秩池化生成的动态图像特征是否能通过捕捉真实与伪造人脸之间的运动差异,有效提升活体检测性能?
  • RQ2所提出的部分共享多模态网络(PSMM-Net)在学习RGB、深度与红外模态之间互补与相关特征方面的有效性如何?
  • RQ3与现有最先进方法相比,该方法在不同种族及未见攻击类型下的泛化能力如何?
  • RQ4在模态多样性与攻击类型多样性各异的多种数据集上,该方法的性能表现如何变化?
  • RQ5新引入的CASIA-SURF CeFA数据集是否可作为评估人脸活体检测中跨种族泛化能力的可靠基准?

主要发现

  • 所提出的SD-Net在CASIA-SURF CeFA数据集上实现了0.35%的ACER,相较于采用相同预训练策略的第二名方法STASN(ACER为0.40%),性能提升0.05%。
  • 在OULU-NPU Protocol 3(跨设备泛化)上,SD-Net实现ACER为2.1%,优于未使用预训练的STASN(ACER为2.8%),展现出强大的零样本泛化能力。
  • 在SiW Protocol 2与3上,该方法在相同预训练条件下分别取得0.15%与4.90%的最佳ACER,证实其在多样化设置下的鲁棒性。
  • 结合多模态融合的PSMM-Net在所有测试数据集上显著提升性能,尤其在跨种族与跨攻击类型泛化场景中表现突出。
  • CASIA-SURF CeFA数据集包含来自非洲、东亚与中亚的1607名受试者,首次支持对人脸活体检测中跨种族效应的全面研究。
  • 消融实验表明,动态图像特征对性能有显著贡献,SD-Net在多个基准上相较仅使用静态特征的基线模型,ACER降低超过1%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。