Skip to main content
QUICK REVIEW

[論文レビュー] Static and Dynamic Fusion for Multi-modal Cross-ethnicity Face Anti-spoofing

Ajian Liu, Zichang Tan|arXiv (Cornell University)|Dec 5, 2019
Biometric Identification and Security参考文献 36被引用数 10
ひとこと要約

本稿では、ランクプールによって生成された動的画像とマルチモーダル融合を活用することで、耐性を高めるために静的・動的統合ネットワーク(SD-Net)と部分共有マルチモーダルネットワーク(PSMM-Net)を提案する。この手法は、CASIA-SURF CeFA、OULU-NPU、SiW、CASIA-SURFの複数のベンチマークで最先端の性能を達成し、新規ベンチマークデータセットにおいてACERが最小0.35%にまで低下する。

ABSTRACT

Regardless of the usage of deep learning and handcrafted methods, the dynamic information from videos and the effect of cross-ethnicity are rarely considered in face anti-spoofing. In this work, we propose a static-dynamic fusion mechanism for multi-modal face anti-spoofing. Inspired by motion divergences between real and fake faces, we incorporate the dynamic image calculated by rank pooling with static information into a conventional neural network (CNN) for each modality (i.e., RGB, Depth and infrared (IR)). Then, we develop a partially shared fusion method to learn complementary information from multiple modalities. Furthermore, in order to study the generalization capability of the proposal in terms of cross-ethnicity attacks and unknown spoofs, we introduce the largest public cross-ethnicity Face Anti-spoofing (CASIA-CeFA) dataset, covering 3 ethnicities, 3 modalities, 1607 subjects, and 2D plus 3D attack types. Experiments demonstrate that the proposed method achieves state-of-the-art results on CASIA-CeFA, CASIA-SURF, OULU-NPU and SiW.

研究の動機と目的

  • 既存の顔フェイク検出手法における動的時間的情報の考慮不足とクロスエスニティ一般化の欠如に対処する。
  • ハンドクラフト特徴量と単一モダリティのディープラーニング手法の限界を克服し、本物とフェイク顔の間の動きの乖離を統合する。
  • RGB、深度、赤外モダリティ間で補完的特徴を効果的に学習できる部分共有マルチモーダルネットワークを構築する。
  • 1607名の被験者を含み、3つのエスニティと4種類の攻撃タイプ(2D/3Dプリント、リプレイ、シリカゲル)を有する、最大規模の公開クロスエスニティ顔フェイク検出データセットCASIA-SURF CeFAを導入する。

提案手法

  • 動的画像を動画シーケンスからランクプールによって生成することで、RGB、深度、赤外の各モダリティごとに静的・動的特徴を同時に学習するSD-Netを提案する。
  • ランクプールを用いて、本物とフェイク顔の間の動きの乖離を計算し、人為的運動特徴量に依存せずに時間的ダイナミクスを捉える。
  • 部分共有ブランチを設計することで、モダリティ固有の特徴と共有特徴の学習を可能にし、補完的かつ相関のある特徴抽出を強化するPSMM-Netを構築する。
  • PSMM-Net内で早期および後期の統合戦略を実装し、複数段階でモダリティ間の相互作用を可能にし、特徴表現を向上させる。
  • 教師あり学習と転移学習の組み合わせを用いてモデルを訓練・評価し、CASIA-SURF CeFAでの事前学習を含む。
  • 交差エントロピー損失とマトリクス学習を用いたマルチステージ訓練パイプラインを実装し、本物とフェイクサンプルの識別を最適化する。

実験結果

リサーチクエスチョン

  • RQ1ランクプールによって得られる動的画像特徴は、本物とフェイク顔の間の動きの乖離を捉えることで、フェイク検出性能を向上させることができるか?
  • RQ2提案された部分共有マルチモーダルネットワーク(PSMM-Net)は、RGB、深度、赤外モダリティ間で補完的かつ相関のある特徴を効果的に学習できるか?
  • RQ3既存のSOTA手法と比較して、提案手法は異なるエスニティおよび未観測の攻撃タイプに対し、どの程度一般化性能を示すか?
  • RQ4異なるモダリティと攻撃多様性を有する多様なデータセットにおいて、提案手法の性能はどのように変化するか?
  • RQ5新たに導入されたCASIA-SURF CeFAデータセットは、顔フェイク検出におけるクロスエスニティ一般化の評価に信頼できるベンチマークとして機能するか?

主な発見

  • 提案されたSD-Netは、同じ事前学習戦略を用いた場合、CASIA-SURF CeFAデータセットでACER 0.35%を達成し、2番目に優れた手法(STASN)の0.05%を上回る性能を示した。
  • OULU-NPUプロトコル3(クロスデバイス一般化)において、SD-Netは事前学習なしでACER 2.1%を達成し、STASNの2.8%を上回り、優れたゼロショット一般化性能を示した。
  • SiWプロトコル2および3において、同じ事前学習条件の下で、ACERはそれぞれ0.15%および4.90%の最良値を記録し、多様な設定下での頑健性を確認した。
  • マルチモーダル統合を備えたPSMM-Netは、すべてのテストデータセットで性能を著しく向上させ、特にクロスエスニティおよびクロスアタック一般化の状況で顕著な効果を示した。
  • 1607名の被験者を含み、アフリカ、東アジア、中央アジアの3つのエスニティをカバーするCASIA-SURF CeFAデータセットにより、顔フェイク検出におけるクロスエスニティ効果の包括的かつ初の研究が可能になった。
  • アブレーションスタディの結果、動的画像特徴が性能に顕著な貢献をしていることが確認され、複数のベンチマークで静的特徴のみのベースラインを1%以上上回るACERを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。