Skip to main content
QUICK REVIEW

[論文レビュー] An Ensemble Model for Face Liveness Detection

Shashank Shekhar, Avinash Patel|arXiv (Cornell University)|Jan 19, 2022
Biometric Identification and Security被引用数 4
ひとこと要約

本論文は、印刷物、写真、動画再生などの提示攻撃を区別するため、顔領域および背景領域からの複数の特徴を統合する、受動的顔の生体認証検出のためのアンサンブル深層学習モデルを提案する。多様な攻撃タイプをカバーする大規模な社内データセット上で訓練された本モデルは、最先端の性能を達成し、困難な攻撃シナリオにおいても頑健性と一般化能力を示す。

ABSTRACT

In this paper, we present a passive method to detect face presentation attack a.k.a face liveness detection using an ensemble deep learning technique. Face liveness detection is one of the key steps involved in user identity verification of customers during the online onboarding/transaction processes. During identity verification, an unauthenticated user tries to bypass the verification system by several means, for example, they can capture a user photo from social media and do an imposter attack using printouts of users faces or using a digital photo from a mobile device and even create a more sophisticated attack like video replay attack. We have tried to understand the different methods of attack and created an in-house large-scale dataset covering all the kinds of attacks to train a robust deep learning model. We propose an ensemble method where multiple features of the face and background regions are learned to predict whether the user is a bonafide or an attacker.

研究の動機と目的

  • オンライン本人確認における顔の提示攻撃という重要な課題に対処すること。
  • 印刷、写真、動画再生攻撃を含むさまざまな攻撃タイプを検出できる、頑健な受動的生体認証検出システムの開発。
  • すべての主要な攻撃カテゴリをカバーする大規模で多様な社内データセットの作成。
  • アンサンブル学習アプローチにより、顔領域および背景領域からの複数の深層特徴を統合することで、検出精度の向上。
  • 実世界の展開環境における生体認証検出モデルの一般化および頑健性の向上。

提案手法

  • モデルは、入力画像の顔領域および背景領域からの特徴を抽出・統合する、深層ニューラルネットワークのアンサンブルを採用する。
  • 顔領域および背景領域に特化した判別的パターンを学習するため、複数の畳み込みニューラルネットワーク(CNN)ブランチを訓練する。
  • 異なるネットワークブランチからの特徴が連結され、最終的な分類器に供給され、生体認証状態(本物か攻撃か)を予測する。
  • アンサンブルアプローチにより、多様な空間領域からの補完的情報を活用し、検出の頑健性を向上させる。
  • 包括的な訓練および評価のため、印刷、写真、動画再生攻撃を含むすべての主要な攻撃タイプをカバーする大規模な社内データセットを収集した。
  • クロスエントロピー損失を用いてエンド・ツー・エンドに訓練され、標準的な指標(正確度、AUC、EER)を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1顔領域および背景領域からの特徴を統合するアンサンブルモデルは、多様な顔の提示攻撃の検出においてどの程度効果的か?
  • RQ2複数の攻撃タイプをカバーする大規模な社内データセットの導入は、生体認証検出モデルの一般化能力を向上させるか?
  • RQ3アンサンブル学習によるマルチリージョン特徴の統合は、単一リージョンまたは単一モデルアプローチよりも優れた性能をもたらすか?
  • RQ4品質や提示方法が異なるスプーフィング攻撃を含む実世界の条件下で、本モデルはどの程度の性能を示すか?
  • RQ5さまざまなタイプの提示攻撃を検出する際、顔特徴と背景特徴の相対的寄与度はどの程度か?

主な発見

  • 提案されたアンサンブルモデルは、社内データセット上で最先端の性能を達成し、正確度およびAUCの観点でベースラインモデルを顕著に上回った。
  • モデルは強力な一般化能力を示し、特に挑戦的な動画再生攻撃や高品質な印刷攻撃を含む、多様な攻撃タイプにおいても高い性能を維持した。
  • 顔領域および背景領域からの特徴を統合することで、顔特徴のみに依存するモデルと比較して、検出精度に顕著な向上が見られた。
  • 背景特徴の導入により、顔のみのモデルが見逃しがちなスプーフィング試行における微細なアーティファクトを検出するのに寄与した。
  • テストセットにおいて等誤差率(EER)が1.5%未満に低下し、本物と攻撃のサンプルをバランスよく検出する高信頼性を示した。
  • アブレーションスタディにより、アンサンブルアーキテクチャが性能向上に顕著な寄与をしていることが確認され、各コンポonentネットワークが独自の判別的能力を提供していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。