Skip to main content
QUICK REVIEW

[論文レビュー] Face Anti-Spoofing Via Disentangled Representation Learning

Ke-Yue Zhang, Taiping Yao|arXiv (Cornell University)|Aug 19, 2020
Biometric Identification and Security参考文献 39被引用数 16
ひとこと要約

本稿では、顔の不正スプーフィングを防ぐための分離表現学習フレームワークを提案する。このフレームワークは、GANに類似した識別器と、LBPマップおよび深度推定による二重の監視を用いて、顔画像内の生体特徴(liveness)とコンテンツ特徴(識別子、照明など)を分離する。自己教師付き分離と多段階の監視により、より汎用的で判別力のある生体特徴空間を学習することで、ベンチマークデータセット上で最先端の性能を達成している。

ABSTRACT

Face anti-spoofing is crucial to security of face recognition systems. Previous approaches focus on developing discriminative models based on the features extracted from images, which may be still entangled between spoof patterns and real persons. In this paper, motivated by the disentangled representation learning, we propose a novel perspective of face anti-spoofing that disentangles the liveness features and content features from images, and the liveness features is further used for classification. We also put forward a Convolutional Neural Network (CNN) architecture with the process of disentanglement and combination of low-level and high-level supervision to improve the generalization capabilities. We evaluate our method on public benchmark datasets and extensive experimental results demonstrate the effectiveness of our method against the state-of-the-art competitors. Finally, we further visualize some results to help understand the effect and advantage of disentanglement.

研究の動機と目的

  • 既存の顔の不正スプーフィング手法が特徴の混同に依存し、学習データに過剰適合するという制限を解消すること。
  • 顔画像内の生体関連表現(スプーフィング関連)をコンテンツ関連特徴(識別子、照明など)から分離すること。
  • 自己教師付き分離によるより強固で判別力のある生体特徴空間を学習することで、モデルの汎用性を向上させること。
  • 生体特徴の内在的性質と、スプーフィングタイプや取得デバイスへの依存性を調査すること。
  • 低レベルのテクスチャ(LBP)と高レベルの深度情報の両方を組み合わせたマルチ監視フレームワークを構築し、より良い生体特徴表現学習を実現すること。

提案手法

  • 本手法は顔画像表現を、生体特徴(スプーフィング関連)とコンテンツ特徴(識別子/照明関連)に分離する二つの独立した部分空間に分解する。
  • 実画像とスプーフィング画像間の特徴交換中に、変換画像の妥当性を保証するためにGANに類似した識別器を用いる。
  • 補助的な深度推定器により、実画像とスプーフィング画像間で生体情報が一貫して伝達されることを保証する。
  • 両方の空間(画像空間と潜在変数空間)に双方向再構成損失を適用し、一貫性を強制するとともに、頑健な生体特徴を抽出する。
  • 低レベルのテクスチャ制約としてLBPマップの監視を導入し、生体特徴空間の正則化を図る。
  • 特徴空間および画像空間の両方に深度監視を適用し、アブレーションにより、特徴と画像の両方に異なる監視を適用する方が、同一の監視設定よりも優れた性能を示すことが確認された。

実験結果

リサーチクエスチョン

  • RQ1分離表現学習は、顔画像内の生体関連パターンとコンテンツ関連の変動を効果的に分離できるか?
  • RQ2LBPや深度といった異なる監視方法は、学習された生体特徴の質や判別力にどのように影響するか?
  • RQ3生体特徴は、スプーフィングタイプ(例:紙、スクリーン)や取得デバイスにどの程度依存するか?
  • RQ4クロスデータセット設定において、分離された生体特徴空間は、混同された表現よりもより良い汎用性を示すか?
  • RQ5生体特徴の内在的性質は何か? また、異なるスプーフィング手法やデバイス間でどのように変化するか?

主な発見

  • LBPマップと深度マップのスコア統合を用いたOULU-NPUプロトコル1において、本手法は1.25%のACERを達成し、最先端の手法を上回った。
  • LBPマップの監視のみで1.56%のACERを達成し、低レベルのテクスチャ手がかりが生体特徴空間の正則化に効果的であることを示した。
  • LBPと深度の監視をスコア統合により組み合わせた場合が最良の性能を示し、ACERは1.25%にまで低下した。これにより、両監視の補完的性質が裏付けられた。
  • t-SNE可視化により、明示的なタイプ監視なしでも、スプーフィングタイプ(例:紙 vs スクリーン)に基づいて生体特徴が明確にクラスタリングされていることが確認された。
  • 実顔の生体特徴はデバイスにかかわらず一貫しており、一方スプーフィング特徴はデバイスによって顕著に異なることが示され、生体表現にデバイス固有のアーティファクトが捉えられていることが示唆された。
  • 画像変換からのデルタマップにより、実顔間では特徴交換に伴い最小限の変化が生じるが、実顔とスプーフィング画像間では大きな、明確に区別可能な変化が生じることが確認され、本手法のスプーフィングアーティファクトへの感受性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。