Skip to main content
QUICK REVIEW

[论文解读] Creating Artificial Modalities to Solve RGB Liveness

Aleksandr Parkin, Oleg Grinchuk|arXiv (Cornell University)|Jun 29, 2020
Biometric Identification and Security参考文献 1被引用 5
一句话总结

本文提出了一种新颖的仅使用RGB的面部反欺骗方法,通过从视频序列中生成人工模态——排序池化和光流——以增强对未见攻击类型和不同种族的鲁棒性。通过应用序列增强并利用轻量级网络融合这些人工特征,该方法在CASIA-SURF CeFA数据集上实现了2.72%的ACER,性能达到当前最先进水平,优于先前方法1.8倍。

ABSTRACT

Special cameras that provide useful features for face anti-spoofing are desirable, but not always an option. In this work we propose a method to utilize the difference in dynamic appearance between bona fide and spoof samples by creating artificial modalities from RGB videos. We introduce two types of artificial transforms: rank pooling and optical flow, combined in end-to-end pipeline for spoof detection. We demonstrate that using intermediate representations that contain less identity and fine-grained features increase model robustness to unseen attacks as well as to unseen ethnicities. The proposed method achieves state-of-the-art on the largest cross-ethnicity face anti-spoofing dataset CASIA-SURF CeFA (RGB).

研究动机与目标

  • 解决在真实场景中仅使用RGB的面部反欺骗问题,其中无法使用红外或深度等附加传感器。
  • 通过减少对身份和细粒度特征的过拟合,提升模型对未见攻击类型和种族的泛化能力。
  • 开发一种鲁棒的端到端流程,利用真实与欺骗视频之间动态外观差异,而无需依赖专用硬件。
  • 证明从视频序列中提取的人工模态可作为物理多模态传感器的有效替代方案。

提出的方法

  • 使用具有两个正则化级别(C=1000和C=1)的排序池化从RGB视频轨迹中创建人工模态,以提取动态外观特征,同时抑制与身份相关的细节。
  • 通过关键帧之间(如首帧与末帧、首帧与第二帧)生成光流表示,以突出真实与欺骗面部动作之间的运动差异。
  • 通过将视频轨迹中的所有帧替换为单个随机选择的帧(标记为伪造)来应用序列增强,以增加伪造样本的多样性并提升泛化能力。
  • 采用随机旋转、颜色抖动和图像偏移等数据增强技术,防止模态崩溃并增强鲁棒性。
  • 使用一个简单、浅层的神经网络(SimpleNet),包含4个卷积块和一个最终的5×5卷积层,将多个人工模态融合为单一预测结果。
  • 使用Adam优化器、批量大小为32和1.5GB GPU内存进行端到端训练,每种协议的收敛时间约为1小时。

实验结果

研究问题

  • RQ1从RGB视频序列中提取的人工模态是否能有效替代物理多模态传感器用于面部反欺骗?
  • RQ2不同级别的排序池化正则化如何影响模型对未见攻击类型和种族的泛化能力?
  • RQ3当与人工模态提取结合时,序列增强在RGB仅反欺骗中能在多大程度上提升鲁棒性?
  • RQ4从RGB视频序列中提取的光流是否能捕捉足够的动态线索以区分真实与欺骗呈现?
  • RQ5仅使用人工模态和标准数据增强技术,轻量级端到端融合网络能否实现最先进性能?

主要发现

  • 所提方法在CASIA-SURF CeFA数据集上实现了2.72%的ACER,创下新SOTA纪录,优于第二名方法1.8倍。
  • 使用C=1000的排序池化将ACER从基线的23.42%降低至12.68%,证明了抑制细粒度特征的有益效果。
  • 仅使用序列增强即可将ACER降低至7.3%,凸显其在提升泛化能力方面的作用,尤其是在与数据增强结合时。
  • 在流程中加入光流后,ACER进一步降低至2.72%,其中APCER仅为0.11%,表明对静态欺骗攻击具有强大检测能力。
  • BPCER达到5.33%,表明真实视频中细微的面部动作仍是挑战,尤其对模仿能力较弱的受试者而言。
  • 人工模态与序列增强的结合显著提升了对未见攻击类型和种族的鲁棒性,验证了该方法的核心假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。