[论文解读] Deep Frequent Spatial Temporal Learning for Face Anti-Spoofing
本文提出 FreqSpatialTempNet,一种双流深度神经网络,通过联合利用光谱、空间和时间特征来提升人脸反欺骗性能。通过使用多帧光谱图像作为输入并引入深度监督,该模型增强了对真实人脸与欺骗人脸的判别能力,同时提出了一种新颖的数据合成管道,可生成大规模欺骗训练数据,显著提升了在跨数据集基准测试中的泛化能力。
Face anti-spoofing is crucial for the security of face recognition system, by avoiding invaded with presentation attack. Previous works have shown the effectiveness of using depth and temporal supervision for this task. However, depth supervision is often considered only in a single frame, and temporal supervision is explored by utilizing certain signals which is not robust to the change of scenes. In this work, motivated by two stream ConvNets, we propose a novel two stream FreqSaptialTemporalNet for face anti-spoofing which simultaneously takes advantage of frequent, spatial and temporal information. Compared with existing methods which mine spoofing cues in multi-frame RGB image, we make multi-frame spectrum image as one input stream for the discriminative deep neural network, encouraging the primary difference between live and fake video to be automatically unearthed. Extensive experiments show promising improvement results using the proposed architecture. Meanwhile, we proposed a concise method to obtain a large amount of spoofing training data by utilizing a frequent augmentation pipeline, which contributes detail visualization between live and fake images as well as data insufficiency issue when training large networks.
研究动机与目标
- 解决人脸反欺骗中欺骗训练数据有限且多样性不足的挑战。
- 通过使用多帧光谱图像作为输入,保留低层次细节以提升欺骗检测能力,从而改善模型泛化性能。
- 通过在统一的深度学习框架中整合频率、空间和时间信息,克服仅使用RGB或仅使用深度输入的局限性。
- 开发一种可扩展的数据合成技术,将欺骗线索从伪造人脸转移到真实人脸,实现大规模训练数据的生成。
- 在跨数据集评估中实现最先进性能,模拟真实世界部署条件。
提出的方法
- 提出双流 FreqSpatialTempNet 架构:一路处理多帧光谱图像以保留低层次欺骗线索,另一路处理RGB图像以进行高层次特征学习。
- 使用深度图像作为监督信号,引导网络学习鲁棒的空间特征,以区分欺骗攻击。
- 应用频域数据增强技术,将真实人脸图像中的块替换为欺骗人脸图像在频域中的对应块,生成逼真的欺骗类训练样本。
- 在光谱流中保留原始的低层次像素级信息,以确保细微的欺骗伪影(例如摩尔纹图案)得以保留并传递至分类器。
- 使用交叉熵损失进行端到端训练,并引入深度图的辅助监督以提升特征判别能力。
- 采用跨数据集测试协议评估泛化性能,分别在 OULU-NPU 上训练并在 SiW 上测试,反之亦然,以模拟真实世界部署。
实验结果
研究问题
- RQ1与仅使用RGB输入相比,多帧光谱图像是否能更好地检测细微的欺骗伪影?
- RQ2结合频域特征与空间和时间监督是否能增强模型在多样化欺骗攻击下的泛化能力?
- RQ3频域数据合成技术能否生成逼真的欺骗样本,从而在数据稀缺的情况下有效训练深度网络?
- RQ4在训练和测试数据来自不同来源的跨数据集评估中,该方法表现如何?
- RQ5深度监督的引入在多大程度上提升了对光照变化和攻击类型变化的鲁棒性?
主要发现
- 在 OULU-NPU 数据集上,该方法在跨测试协议2中实现了 7.8% 的 ACER,优于基线模型 AuxNet(14.1%),展现出强大的泛化能力。
- 在 SiW 数据集上,当在 OULU-NPU 加上合成数据上训练时,模型实现了 0.71% 的 ACER,优于 Temporal-Depth 方法在跨测试条件下的内部测试结果(0.15±0.14)。
- 使用合成数据后,SiW 协议1中的 ACER 从 7.28% 降低至 0.71%,表明合成数据能有效提升模型的鲁棒性和泛化能力。
- 可视化结果证实,合成图像在局部区域表现出伪造特有的伪影(如摩尔纹图案),同时保留了原始身份,使模型能够学习具有判别性的欺骗线索。
- 该模型在 SiW 和 OULU-NPU 的全部三个协议上均实现了最先进性能,跨数据集评估中的 ACER 低于现有方法,证明了其卓越的泛化能力。
- 频域数据合成方法成功地将欺骗特征从伪造人脸转移到真实人脸,实现了无需真实欺骗样本即可大规模生成数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。