[论文解读] Domain Generalization via Shuffled Style Assembly for Face Anti-Spoofing
该论文提出了一种新型的混洗风格聚合网络(SSAN),用于实现域泛化的人脸反面 spoofing 检测,通过分离内容与风格特征,利用对抗学习实现域不变的内容表征,并通过对比学习突出与活体相关的风格特征,同时抑制域特定特征。该方法在标准基准和新提出的大型基准上均取得了最先进性能,展现出在未见域上的强大泛化能力。
With diverse presentation attacks emerging continually, generalizable face anti-spoofing (FAS) has drawn growing attention. Most existing methods implement domain generalization (DG) on the complete representations. However, different image statistics may have unique properties for the FAS tasks. In this work, we separate the complete representation into content and style ones. A novel Shuffled Style Assembly Network (SSAN) is proposed to extract and reassemble different content and style features for a stylized feature space. Then, to obtain a generalized representation, a contrastive learning strategy is developed to emphasize liveness-related style information while suppress the domain-specific one. Finally, the representations of the correct assemblies are used to distinguish between living and spoofing during the inferring. On the other hand, despite the decent performance, there still exists a gap between academia and industry, due to the difference in data quantity and distribution. Thus, a new large-scale benchmark for FAS is built up to further evaluate the performance of algorithms in reality. Both qualitative and quantitative results on existing and proposed benchmarks demonstrate the effectiveness of our methods. The codes will be available at https://github.com/wangzhuo2019/SSAN.
研究动机与目标
- 为解决人脸反面 spoofing 中的域泛化挑战,即模型在未见攻击类型和数据集上性能下降的问题。
- 克服现有方法在完整表征上操作的局限性,通过利用全局(内容)与局部(风格)图像统计特性的差异特性。
- 通过新提出的大型、真实的人脸反面 spoofing 基准,弥合学术基准与真实工业部署之间的差距。
- 开发一种端到端、高效的训练框架,利用特征级风格迁移与对比学习,提升模型泛化能力。
提出的方法
- 该方法采用双流网络,分别提取内容特征(全局语义与物理属性)和风格特征(局部纹理与活体线索)。
- 通过对抗学习对内容特征进行正则化,以实现跨不同数据集的域不变表征。
- 通过对比学习策略增强风格特征,突出与活体相关的模式,同时抑制域特定的伪影。
- 通过多层堆叠的混洗风格聚合机制,将内容与风格特征重新组合为风格化特征,实现多样化且鲁棒的特征组合。
- 在对比学习过程中使用梯度截断操作,以稳定训练并提升特征解耦效果。
- 设计了端到端的训练流水线,具备可扩展性与高效性,适用于大规模工业数据集。
实验结果
研究问题
- RQ1在跨域设置下,分离内容与风格特征是否能提升人脸识别反面 spoofing 检测的泛化能力?
- RQ2如何有效强调与活体相关的风格信息,同时抑制特征表征中的域特定噪声?
- RQ3与图像级或两阶段增强相比,特征级风格迁移结合混洗聚合在多大程度上提升了模型鲁棒性?
- RQ4所提出方法在反映真实世界数据分布与规模的现实性、大规模基准上的表现如何?
- RQ5各组件(对抗学习、对比学习、梯度截断等)对最终性能的贡献分别是什么?
主要发现
- SSAN-M 在 O&C&I 到 M 协议上实现 10.42% HTER 和 94.76% AUC,优于所有消融实验变体。
- SSAN-R 在 O&M&I 到 C 协议上实现 6.67% HTER 和 98.75% AUC,展现出在未见域上的卓越泛化能力。
- 消融研究证实,若移除对比损失(L_contra),HTER 上升 2.08%,表明其在抑制域特定特征中的关键作用。
- 梯度截断操作有助于提升泛化能力,SSAN-M 带梯度截断的版本比无该操作的变体 HTER 降低 1.08%。
- t-SNE 可视化结果表明,风格化特征在活体与伪造样本之间学习到更具可分性、更鲁棒的域不变表征。
- Grad-CAM 可视化显示,模型能有效关注到摩尔纹图案、打印切割边缘等伪造线索,验证了其对活体相关纹理的检测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。