Skip to main content
QUICK REVIEW

[論文レビュー] On the Learning of Deep Local Features for Robust Face Spoofing Detection

Gustavo Botelho de Souza, João Paulo Papa|arXiv (Cornell University)|Jun 19, 2018
Biometric Identification and Security被引用数 4
ひとこと要約

本論文では、まず局所的顔領域で事前学習を行い、偽物のスプーフィング特徴を学習した後、全体顔で微調整する二段階のCNNアーキテクチャ、lsCNNを提案する。局所的特徴に特化した深層特徴を活用することで、全体的またはランダムなパッチベースの学習手法と比較して、より高速な収束性と向上した耐性を示し、Replay-AttackおよびCASIA FASDデータセットで最先端の性能を達成した。

ABSTRACT

Biometrics emerged as a robust solution for security systems. However, given the dissemination of biometric applications, criminals are developing techniques to circumvent them by simulating physical or behavioral traits of legal users (spoofing attacks). Despite face being a promising characteristic due to its universality, acceptability and presence of cameras almost everywhere, face recognition systems are extremely vulnerable to such frauds since they can be easily fooled with common printed facial photographs. State-of-the-art approaches, based on Convolutional Neural Networks (CNNs), present good results in face spoofing detection. However, these methods do not consider the importance of learning deep local features from each facial region, even though it is known from face recognition that each facial region presents different visual aspects, which can also be exploited for face spoofing detection. In this work we propose a novel CNN architecture trained in two steps for such task. Initially, each part of the neural network learns features from a given facial region. Afterwards, the whole model is fine-tuned on the whole facial images. Results show that such pre-training step allows the CNN to learn different local spoofing cues, improving the performance and the convergence speed of the final model, outperforming the state-of-the-art approaches.

研究の動機と目的

  • 印刷された写真やデジタルレプリカを用いたスプーフィング攻撃に対して脆弱な顔認識システムの問題に対処すること。
  • 異なる顔領域から深層局所特徴を学習することで、スプーフィング検出性能が向上するかどうかを調査すること。
  • 特徴学習の効率性とスプーフィング検出におけるモデルの汎化能力を向上させる訓練戦略を開発すること。
  • 構造的な事前学習により、領域特有のスプーフィング特徴を活用することで、既存のCNNベースの手法を上回ること。

提案手法

  • 本手法は二段階の訓練プロセスを採用する:まず、固定された事前に定義された顔領域(例:目、鼻、口)に対して個々の「PatchNet」を訓練し、局所的スプーフィング特徴を学習する。
  • 各PatchNetは、割り当てられた顔領域に特化した深層特徴を学習する小型で専用のCNNである。
  • 局所的事前学習が終了した後、すべてのPatchNetの重みが統合され、全体顔画像でのグローバルな微調整用に統合された「lsCNN」モデルが構築される。
  • 微調整段階では、基本学習率0.0001、モーメンタムパラメータ0.9および0.999、バッチサイズ64を用いた標準的な誤差逆伝播法が使用される。
  • アーキテクチャはCaffeフレームワークを用いて実装され、Replay-AttackおよびCASIA FASDデータセットの両方で訓練が行われた。
  • 最終的なモデルは、検証セットおよびテストセットにおいて等誤差率(EER)および半全誤差率(HTER)を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1全体的またはランダムなパッチベースの学習と比較して、局所的顔領域での事前学習がスプーフィング攻撃の検出性能を向上させるか?
  • RQ2領域特有のスプーフィング特徴を学習することで、顔スプーフィング検出のための深層CNNにおける収束速度と汎化性能が向上するか?
  • RQ3標準的なベンチマークデータセットにおいて、EERおよびHTERの観点から、lsCNNの性能は最先端の手法と比較してどうなるか?
  • RQ4大規模で複雑なモデルを必要とせずに、コンactなCNNアーキテクチャに対しても、二段階の訓練戦略が効果的に適用可能か?

主な発見

  • Replay-Attackデータセットでは、lsCNNはEER 0.33%、HTER 2.50%を達成し、従来の訓練済みlsCNN(HTER: 1.75%)を上回り、最良の性能を示す手法と同等の結果を出した。
  • lsCNNモデルはイテレーション53,600で最高の性能に達したが、従来の訓練済みCNNは最高結果を得るまでに74,200イテレーションを要したため、はるかに早期に収束した。
  • CASIA FASDデータセットでは、lsCNNはEER 4.44%を達成し、VGG-Faceのような大規模アーキテクチャを用いた手法と同等の性能を示した。
  • 従来の訓練済みバージョンと比較して、lsCNNモデルははるかに高速に収束し、ピーク性能に到達するまでのイテレーションは9,800に対し、ベースラインは80,900に達した。
  • 局所的事前学習ステップにより、モデルの判別力のあるスプーフィング特徴の学習能力が向上し、収束性と耐性が向上した。
  • コンパクトなCNNアーキテクチャを用いても最先端の性能を達成した。これは、局所特徴学習が正確性と訓練効率の両方を向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。