Skip to main content
QUICK REVIEW

[論文レビュー] Taming Self-Supervised Learning for Presentation Attack Detection: In-Image De-Folding and Out-of-Image De-Mixing.

Haozhe Liu, Zhe Kong|arXiv (Cornell University)|Sep 9, 2021
Digital Media Forensic Detection参考文献 46被引用数 4
ひとこと要約

本論文では、未知の提示攻撃装置(PAI)に対する汎化性能を向上させるために、画像内での展開(サイクル整合性を用いた局所的特徴学習)と画像外での混合解除(トポロジカル整合性を用いたグローバルなインスタンス固有特徴学習)を組み合わせた自己教師あり学習手法、IF-OMを提案する。CASIA-FASDおよびIdiap Replay-Attackで学習した場合、OULU-NPUおよびMSU-MFSDで18.60%のEERを達成し、ベースライン手法を9.54%のEER低減率で上回る。

ABSTRACT

Biometric systems are vulnerable to the Presentation Attacks (PA) performed using various Presentation Attack Instruments (PAIs). Even though there are numerous Presentation Attack Detection (PAD) techniques based on both deep learning and hand-crafted features, the generalization of PAD for unknown PAI is still a challenging problem. The common problem with existing deep learning-based PAD techniques is that they may struggle with local optima, resulting in weak generalization against different PAs. In this work, we propose to use self-supervised learning to find a reasonable initialization against local trap, so as to improve the generalization ability in detecting PAs on the biometric system.The proposed method, denoted as IF-OM, is based on a global-local view coupled with De-Folding and De-Mixing to derive the task-specific representation for PAD.During De-Folding, the proposed technique will learn region-specific features to represent samples in a local pattern by explicitly maximizing cycle consistency. While, De-Mixing drives detectors to obtain the instance-specific features with global information for more comprehensive representation by maximizing topological consistency. Extensive experimental results show that the proposed method can achieve significant improvements in terms of both face and fingerprint PAD in more complicated and hybrid datasets, when compared with the state-of-the-art methods. Specifically, when training in CASIA-FASD and Idiap Replay-Attack, the proposed method can achieve 18.60% Equal Error Rate (EER) in OULU-NPU and MSU-MFSD, exceeding baseline performance by 9.54%. Code will be made publicly available.

研究の動機と目的

  • 未知の提示攻撃装置(PAI)に対するプレゼンテーションアタック検出(PAD)における汎化性能の向上に挑戦する。
  • 深層学習ベースのPAD手法がしばしば局所最適解に陥りがちで、汎化性能が低下するという制限を克服する。
  • 自己教師あり事前学習を活用することで、PADの表現学習を向上させ、悪質な局所的極小値を回避する。
  • 局所的(領域特化型)およびグローバル(インスタンス特化型)特徴を同時に捉える統合フレームワークを構築し、頑健なPADを実現する。
  • OULU-NPUおよびMSU-MFSDを含む複雑でハイブリッドなデータセットにおいて、クロスデータセット評価下でも優れた性能を示す。

提案手法

  • 画像内での展開と画像外での混合解除を組み合わせたグローバル・ローカル対照学習フレームワークを提案し、自己教師あり表現学習を実現する。
  • クロップされた画像領域間のサイクル整合性を最大化することで展開を実装し、局所的・領域特化型特徴を学習する。
  • 異なる増幅処理間のトポロジカル整合性を最大化することで混合解除を実装し、グローバル・インスタンス固有特徴を学習する。
  • 自己教師あり特徴を、局所最適解のリスクを低減するための強力な初期化として、下流のPAD分類タスクに活用する。
  • 標準的な交差エントロピー損失を用い、エンド・トゥ・エンドのファインチューニングにより、自己教師あり特徴上で最終的なPAD分類器を学習する。
  • 局所的およびグローバル表現の両方を活用することで、実世界のバイオメトリクスシステムにおける多様で未知のPAIに対する耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1展開と混合解除を用いた自己教師あり学習は、未知の提示攻撃装置に対するPADの汎化性能を向上させることができるか?
  • RQ2提案されたグローバル・ローカル対照学習フレームワークは、多様なデータセットにおいてPADの判別的特徴をどれほど効果的に捉えられるか?
  • RQ3自己教師あり初期化は、深層学習ベースのPADモデルにおける局所最適解のリスクをどの程度低減するか?
  • RQ4IF-OM手法は、OULU-NPUおよびMSU-MFSDにおけるクロスデータセット評価で、最先端のPAD手法をどのように上回るか?
  • RQ5画像内での展開と画像外での混合解除の組み合わせは、従来の自己教師ありまたは教師ありアプローチよりも優れた汎化性能を達成できるか?

主な発見

  • 提案されたIF-OM手法は、CASIA-FASDおよびIdiap Replay-Attackで学習した場合、OULU-NPUおよびMSU-MFSDで18.60%の等誤差率(EER)を達成し、ベースライン手法を顕著に上回る。
  • ベースライン手法に対するEERの改善は9.54百分率ポイントであり、未知のPAIおよび複雑なデータセットへの強力な汎化性能を示している。
  • 本手法は顔認識と指紋認識の両方のPADタスクで一貫した性能向上を示しており、広範な適用可能性を示している。
  • サイクル整合性およびトポロジカル整合性を用いた自己教師あり事前学習の活用により、局所最適解のリスクが低減され、モデルの頑健性が向上している。
  • 展開および混合解除のコンponentsは、効果的に局所的なテクスチャパターンとグローバルな構造的情報を捉えており、検出精度の向上に寄与している。
  • コードは公開予定であり、自己教師ありPAD分野における再現性およびさらなる研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。