Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Modal Face Anti-Spoofing Based on Central Difference Networks

Zitong Yu, Yunxiao Qin|arXiv (Cornell University)|Apr 17, 2020
Biometric Identification and Security参考文献 42被引用数 10
ひとこと要約

本論文は、中央差分畳み込みネットワーク(CDCN)に基づくマルチモーダル顔偽造検出手法を提案する。CDCNをRGB、深度、赤外モダリティを統合的にモデル化するように拡張し、本質的な偽造パターンを捉える。最先端の性能を達成し、ChaLearn FAS Challenge 2020のマルチモーダルトラックで1位、シングルモーダル(RGB)トラックで2位を獲得。それぞれ1.02% ± 0.59% ACER、4.84% ± 1.79% ACERを達成した。

ABSTRACT

Face anti-spoofing (FAS) plays a vital role in securing face recognition systems from presentation attacks. Existing multi-modal FAS methods rely on stacked vanilla convolutions, which is weak in describing detailed intrinsic information from modalities and easily being ineffective when the domain shifts (e.g., cross attack and cross ethnicity). In this paper, we extend the central difference convolutional networks (CDCN) \cite{yu2020searching} to a multi-modal version, intending to capture intrinsic spoofing patterns among three modalities (RGB, depth and infrared). Meanwhile, we also give an elaborate study about single-modal based CDCN. Our approach won the first place in "Track Multi-Modal" as well as the second place in "Track Single-Modal (RGB)" of ChaLearn Face Anti-spoofing Attack Detection Challenge@CVPR2020 \cite{liu2020cross}. Our final submission obtains 1.02$\pm$0.59\% and 4.84$\pm$1.79\% ACER in "Track Multi-Modal" and "Track Single-Modal (RGB)", respectively. The codes are available at{https://github.com/ZitongYu/CDCN}.

研究の動機と目的

  • ドメインシフト(クロスアタックやクロスエスニシティなど)下でのvanilla CNNの細粒度な偽造パターンの捉え方の限界を是正すること。
  • CDCNの有効性をRGBモダリティを超えて、特に顔偽造検出における深度および赤外モダリティに適用することの検証。
  • RGB、深度、赤外入力を統合する、多様な偽造攻撃およびエスニシティにわたる一般化を向上させる、頑健なマルチモーダル統合戦略の開発。
  • 特にCASIA-SURF CeFAデータセットのプロトコル4(同時にクロスアタックおよびクロスエスニシティ)において、最先端の性能を達成すること。

提案手法

  • 中央差分畳み込み(CDC)演算を適応し、RGB、深度、赤外モダリティのいずれに対しても、高コントラストでエッジに敏感な特徴を抽出することで、微細な偽造アーティファクトを強調する。
  • 各モダリティ(RGB、深度、IR)に対してCDCNをシングルモーダルバックボーンとして適用し、照明、テクスチャ、素材の変動に対して不変な特徴を学習可能にする。
  • 深層特徴を全3モダリティから連結することで、特徴レベルの統合を実装し、補完的な偽造サインを捉える統一された表現を形成する。
  • 特徴レベル統合が不十分な場合(特に未知のエスニシティにおいて)、重み付き平均(0.5 × RGB + 0.5 × 深度)を用いたスコアレベル統合を実装し、耐性を向上させる。
  • 超パrameter θ(0.5、0.7、0.9)を最適化し、サブプロトコル間の信頼度スコアのバランスを調整することで、クロスエスニシティベンチマークにおける一般化性能を向上させる。
  • CASIA-SURF CeFAデータセットのプロトコル4(同時にクロスアタックおよびクロスエスニシティ)において、モデルを訓練および評価し、ベンチマークで最も困難な設定を想定する。

実験結果

リサーチクエスチョン

  • RQ1顔偽造検出において、深度や赤外といったRGB以外のモダリティにCDCNを適用した場合、その性能はいかがなものか?
  • RQ2CDCNは、クロスエスニシティやクロスアタックタイプのようなドメインシフト下でも、複数のモダリティにわたって本質的な偽造パターンを効果的に捉えることができるか?
  • RQ3入力レベル、特徴レベル、スコアレベルのいずれの統合戦略が、困難なプロトコル下でのマルチモーダル顔偽造検出において最高のパフォーマンスを発揮するか?
  • RQ4異なる照明、カメラ、素材条件下で、CDCNは標準CNNと比較して、微細な偽造アーティファクトをどれほど効果的に捉えることができるか?
  • RQ5マルチモーダルCDCNは、実際の偽造攻撃が存在する中で、未知のエスニシティグループにどれほど一般化できるか?

主な発見

  • 提案されたマルチモーダルCDCNは、ChaLearn FAS Challenge 2020のマルチモーダルトラックで1.02% ± 0.59% ACERを達成し、1位を獲得した。
  • シングルモーダル(RGB)トラックでは4.84% ± 1.79% ACERを達成し、2位にランクインした。これは、単一モーダル設定下でも優れたパフォーマンスを示している。
  • 深度モダリティは、すべてのプロトコルで最も一貫性のある性能を示し、特に印刷攻撃の検出およびエスニシティにわたる一般化において優れた性能を発揮した。
  • 赤外モダリティは、プロトコル4@1(アフリカを除く)で最高の性能を示したが、プロトコル4@2および4@3(アフリカを含む)では低性能にとどまり、未知のエスニシティグループへの一般化が限定的であることが示された。
  • 全3モダリティを用いた特徴レベル統合は、プロトコル4@1で最低のACER(0.42%)を達成し、個々のモダリティや単純な統合手法を上回った。
  • スコアレベル統合(0.5 × RGB + 0.5 × 深度)は、単一深度モダリティと比較して、プロトコル4@2および4@3でそれぞれ0.54%および1.13%のACER低減を達成し、アンサンブル戦略の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。