[论文解读] Multi-Modal Face Anti-Spoofing Based on Central Difference Networks
该论文提出了一种基于中心差分卷积网络(CDCN)的多模态人脸反制欺骗方法,将CDCN扩展至联合建模RGB、深度和红外模态,以捕捉内在的欺骗模式。该方法在ChaLearn FAS Challenge 2020中取得最先进性能,多模态赛道排名第一,单模态(RGB)赛道排名第二,分别取得1.02% ± 0.59% ACER和4.84% ± 1.79% ACER的性能。
Face anti-spoofing (FAS) plays a vital role in securing face recognition systems from presentation attacks. Existing multi-modal FAS methods rely on stacked vanilla convolutions, which is weak in describing detailed intrinsic information from modalities and easily being ineffective when the domain shifts (e.g., cross attack and cross ethnicity). In this paper, we extend the central difference convolutional networks (CDCN) \cite{yu2020searching} to a multi-modal version, intending to capture intrinsic spoofing patterns among three modalities (RGB, depth and infrared). Meanwhile, we also give an elaborate study about single-modal based CDCN. Our approach won the first place in "Track Multi-Modal" as well as the second place in "Track Single-Modal (RGB)" of ChaLearn Face Anti-spoofing Attack Detection Challenge@CVPR2020 \cite{liu2020cross}. Our final submission obtains 1.02$\pm$0.59\% and 4.84$\pm$1.79\% ACER in "Track Multi-Modal" and "Track Single-Modal (RGB)", respectively. The codes are available at{https://github.com/ZitongYu/CDCN}.
研究动机与目标
- 为解决普通CNN在跨攻击类型和跨种族等域偏移条件下难以捕捉细粒度欺骗模式的局限性。
- 探究CDCN在RGB模态以外的模态(特别是深度和红外模态)在人脸反制欺骗任务中的有效性。
- 开发一种鲁棒的多模态融合策略,整合RGB、深度和红外输入,以提升在多样化欺骗攻击和种族背景下的泛化能力。
- 在具有挑战性的跨种族和跨攻击类型协议中实现最先进性能,特别是在CASIA-SURF CeFA数据集的协议4中。
提出的方法
- 将中心差分卷积(CDC)操作适配用于提取高对比度、边缘敏感的特征,以突出显示RGB、深度和红外模态中的细微欺骗痕迹。
- 将CDCN作为各模态(RGB、深度、红外)的单模态主干网络,使网络能够学习对光照、纹理和材质变化不敏感的判别性模式。
- 通过拼接所有三种模态的深层特征实现特征级融合,形成统一的表示,以捕捉互补的欺骗线索。
- 采用加权平均的分数级融合(0.5 × RGB + 0.5 × 深度)以增强鲁棒性,尤其在特征级融合表现不佳时,如面对未见的种族群体。
- 通过超参数θ(0.5、0.7、0.9)优化融合策略,以平衡子协议间的置信度分数,提升在跨种族基准上的泛化能力。
- 在CASIA-SURF CeFA数据集的协议4(同时存在跨攻击和跨种族)下进行模型训练与评估,该设置是基准中最具挑战性的。
实验结果
研究问题
- RQ1当将CDCN应用于深度和红外等非RGB模态时,在人脸反制欺骗任务中表现如何?
- RQ2CDCN是否能有效捕捉多种模态中的内在欺骗模式,尤其是在跨种族和跨攻击类型等域偏移条件下?
- RQ3在具有挑战性的协议下,输入级、特征级或分数级融合策略中,哪种策略在多模态人脸反制欺骗任务中表现最佳?
- RQ4在光照、相机和材质条件变化下,CDCN与标准CNN相比,在捕捉细粒度欺骗痕迹方面表现如何?
- RQ5多模态CDCN在未见种族群体中的泛化能力有多强,尤其是在存在真实欺骗攻击的情况下?
主要发现
- 所提出的多模态CDCN在ChaLearn FAS Challenge 2020的多模态赛道中达到1.02% ± 0.59% ACER,获得第一名。
- 在单模态(RGB)赛道中,该方法达到4.84% ± 1.79% ACER,排名第二,表明其在单模态设置下也具备强大性能。
- 深度模态在所有协议中表现最为稳定,尤其在检测打印攻击和跨种族泛化方面表现优异。
- 红外模态在协议4@1(不含非洲群体)中表现最佳,但在协议4@2和4@3(含非洲群体)中表现较差,表明其对未见种族群体的泛化能力有限。
- 在协议4@1中,三模态联合的特征级融合实现最低ACER(0.42%),优于单一模态和简单融合方法。
- 分数级融合(0.5 × RGB + 0.5 × 深度)相较于单深度模态,在协议4@2和4@3中分别将ACER降低0.54%和1.13%,证实了集成策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。