Skip to main content
QUICK REVIEW

[論文レビュー] A Comprehensive Evaluation on Multi-channel Biometric Face Presentation Attack Detection

Anjith George, David Geissbühler|arXiv (Cornell University)|Feb 21, 2022
Biometric Identification and Security被引用数 5
ひとこと要約

本論文は、RGB、NIR、SWIR、深度、赤外線を含む14種類の画像モダリティを備えた包括的なデータセットを用いて、マルチチャネルバイオメトリクス的顔認識プレゼンテーション攻撃検出(PAD)を評価する。RGBとSWIRチャネルを組み合わせることで、既知および未知の攻撃、特に遮蔽攻撃に対して顕著に高い耐性を示すことが実証された。低解像度のSWIRセンサーでも高い性能を維持するため、最小限のハードウェアコストで安全なPADシステムを実現可能である。

ABSTRACT

The vulnerability against presentation attacks is a crucial problem undermining the wide-deployment of face recognition systems. Though presentation attack detection (PAD) systems try to address this problem, the lack of generalization and robustness continues to be a major concern. Several works have shown that using multi-channel PAD systems could alleviate this vulnerability and result in more robust systems. However, there is a wide selection of channels available for a PAD system such as RGB, Near Infrared, Shortwave Infrared, Depth, and Thermal sensors. Having a lot of sensors increases the cost of the system, and therefore an understanding of the performance of different sensors against a wide variety of attacks is necessary while selecting the modalities. In this work, we perform a comprehensive study to understand the effectiveness of various imaging modalities for PAD. The studies are performed on a multi-channel PAD dataset, collected with 14 different sensing modalities considering a wide range of 2D, 3D, and partial attacks. We used the multi-channel convolutional network-based architecture, which uses pixel-wise binary supervision. The model has been evaluated with different combinations of channels, and different image qualities on a variety of challenging known and unknown attack protocols. The results reveal interesting trends and can act as pointers for sensor selection for safety-critical presentation attack detection systems. The source codes and protocols to reproduce the results are made available publicly making it possible to extend this work to other architectures.

研究の動機と目的

  • 2D、3D、部分的攻撃を含む多様な攻撃タイプにわたる顔プレゼンテーション攻撃検出(PAD)における、RGB、NIR、SWIR、深度、赤外線といった多様な画像モダリティの有効性を評価すること。
  • 安全性が求められるPADシステムにおいて、性能とコストのバランスを最適化するチャネルの組み合わせを同定すること。
  • 特にSWIRチャネルにおいて、効果的なPAD性能を発揮するための最小解像度要件を特定すること。
  • 実世界の展開に不可欠な要件である、未知の攻撃プロトコルに対する各チャネルの耐性を評価すること。
  • 今後の研究のための再現可能性を確保するため、公開可能なマルチチャネルPADデータセットとコードを提供すること。

提案手法

  • 本研究では、実物とスプーフィングの顔サンプルを分類するために、ピixe単位のバイナリラベルを用いたマルチチャネル畳み込みニューラルネットワークを採用する。
  • 複数の画像解像度レベルで、RGB、RGB-SWIR、RGB-NIRなどのさまざまなチャネルの組み合わせを評価する実験を実施する。
  • モデルは、ネットワークの入力層にチャネルをスタックする早期融合戦略を採用しており、スコアまたは特徴量レベルの融合戦略を上回る性能を示す。
  • 14のセンシングモダリティを1サンプルに含む大規模データセット、HQ-WMCAを用いる。このデータセットは、2D、3D、部分的攻撃をカバーする。
  • 一般化性能と耐性を評価するため、既知および未知の攻撃プロトコルを含む分析を実施する。
  • 再現性と他のアーキテクチャへの拡張性を確保するため、ソースコードと実験プロトコルを公開する。

実験結果

リサーチクエスチョン

  • RQ1顔PADにおける既知および未知のプレゼンテーション攻撃に対して、最高の耐性を示す画像モダリティの組み合わせは何か?
  • RQ2特にSWIRチャネルにおいて、個々のチャネルの解像度はPAD性能とシステムコストにどのように影響するか?
  • RQ3なぜSWIRチャネル、特に1450nmでは、困難な遮蔽攻撃を検出する能力が優れているのか?
  • RQ4スコアまたは特徴量レベルの融合と比較して、マルチチャネル入力の早期融合は、検出精度においてどのように異なるか?
  • RQ5低解像度のSWIRセンサーは、高精度なPAD性能を維持できるか。これにより、実世界のシステムへのコスト効率の良い展開が可能になるか?

主な発見

  • RGBとSWIRチャネルの組み合わせが、すべての攻撃プロトコルにおいて最高の性能を示し、個々のチャネルを著しく上回る。
  • SWIRチャネル、特に1450nmでは、皮膚の識別能を向上させる水の吸収特性のおかげで、遮蔽攻撃に対して顕著な耐性を示す。
  • RGB-SWIR_1450nmは、フルRGB-SWIR統合と同等の性能を達成しており、高精度な検出に1つのSWIR波長で十分である可能性を示唆する。
  • モデルの精度は非常に低解像度になるとしか低下せず、低解像度のSWIRセンサー(例:320x240)でも強力な性能を維持できることを示しており、ハードウェアコストの低減が可能である。
  • マルチチャネル入力の早期融合は、スコアレベルおよび特徴量レベルの融合を常に上回り、後者2つはしばしば性能を低下させる。
  • RGB-SWIRの組み合わせは、未知の攻撃への一般化性能が著しく優れており、セキュリティが求められるアプリケーションに最適である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。