Skip to main content
QUICK REVIEW

[論文レビュー] TransRPPG: Remote Photoplethysmography Transformer for 3D Mask Face Presentation Attack Detection

Zitong Yu, Xiaobai Li|arXiv (Cornell University)|Apr 15, 2021
Non-Invasive Vital Sign Monitoring参考文献 37被引用数 6
ひとこと要約

本稿では、3Dマスクフェイスプレゼンテーションアタック検出(PAD)のため、顔面および背景のマルチスケール時空間マップから、内在的なrPPGベースの生体認証表現を自動で学習する軽量なビジョントランスフォーマー枠組み、TransRPPGを提案する。本手法は、わずか547Kパラメータおよび763M FLOPsで、クロスデータセットテストにおいて98.77% AUCの最先端性能を達成した。

ABSTRACT

3D mask face presentation attack detection (PAD) plays a vital role in securing face recognition systems from emergent 3D mask attacks. Recently, remote photoplethysmography (rPPG) has been developed as an intrinsic liveness clue for 3D mask PAD without relying on the mask appearance. However, the rPPG features for 3D mask PAD are still needed expert knowledge to design manually, which limits its further progress in the deep learning and big data era. In this letter, we propose a pure rPPG transformer (TransRPPG) framework for learning intrinsic liveness representation efficiently. At first, rPPG-based multi-scale spatial-temporal maps (MSTmap) are constructed from facial skin and background regions. Then the transformer fully mines the global relationship within MSTmaps for liveness representation, and gives a binary prediction for 3D mask detection. Comprehensive experiments are conducted on two benchmark datasets to demonstrate the efficacy of the TransRPPG on both intra- and cross-dataset testings. Our TransRPPG is lightweight and efficient (with only 547K parameters and 763M FLOPs), which is promising for mobile-level applications.

研究の動機と目的

  • ディープラーニングおよびビッグデータ環境下での進展を妨げる、手作業で設計されたrPPG特徴量の限界を解消すること。
  • エキスパートが設計した特徴量に依存しない、エンドツーエンドでデータ駆動型のrPPG表現学習フレームワークを構築すること。
  • ビジョントランスフォーマーがrPPG信号におけるグローバルな時空間的関係をモデル化する有効性を検証すること。
  • 特に低精細または高精細の3Dマスク攻撃シナリオにおいても、一般化性能およびロバストネスを向上させること。
  • 最小限の計算コストでモバイルレベルのデプロイメントに適した軽量アーキテクチャを設計すること。

提案手法

  • 複数の顔面領域の注目領域(ROIs)からの生のカラー分散信号を用いて、顔面皮膚および背景領域からマルチスケール時空間マップ(MSTmaps)を構築する。
  • 共有重みを有する2本のブランチ型ビジョントランスフォーマーを用い、MSTmapsからrPPGおよび環境特徴量を抽出することで、顔面および背景信号の分離学習を可能にする。
  • 変更可能な空間的および時間的パッチサイズ(例:1×15の重複を伴う3×30)を用いて、MSTmapsをパッチ単位でトークン化し、トランスフォーマー入力として利用する。
  • ビジョントランスフォーマー内の自己注意機構を活用し、MSTmaps内での長距離依存関係およびグローバルな関係をモデル化することで、生体認証表現を強化する。
  • 顔面および背景ブランチからの特徴量学習を個別にガイドするため、2つの独立したスーパービジョンヘッドおよび損失関数($\mathcal{L}_{face}$ および $π_{bg}$)を導入する。
  • 追加のトランスフォーマーレイヤーを用いて統合特徴量を精緻化し、最終的な二値予測(本物対3Dマスク攻撃)を出力する。

実験結果

リサーチクエスチョン

  • RQ1手作業で設計された信号処理に依存せずに、純粋なトランスフォーマー基盤フレームワークが、3DマスクPADのための効果的なrPPG特徴量を自動で学習できるか?
  • RQ2MSTmap入力の設計要因(空間的・時間的解像度、パッチサイズ、オーバーラップ)が、トランスフォーマーの生体認証検出性能に与える影響は何か?
  • RQ3背景領域特徴量の貢献度は何か?また、顔面と背景からの分離学習は、ロバストネスを向上させるか?
  • RQ4データ品質や攻撃の忠実度にばらつきがあるデータセット間で、モデルの一般化性能はいかがであり、特に限られたデータで学習した場合の性能は?
  • RQ5軽量なトランスフォーマー・アーキテクチャは、最小限のパラメータおよびFLOPsで高い精度を達成でき、モバイルデプロイメントに適しているか?

主な発見

  • TransRPPGは、クロスデータセットテスト(MARsV2 → 3DMAD)で98.77% AUCを達成し、優れた一般化能力を示した。
  • 10秒の動画クリップでは96.89% AUC、7秒のクリップでは96.06% AUCを達成し、短い入力シーケンスに対してもロバストであることが示された。
  • 動画長が5秒未満になるとAUCが90%未満に低下し、時間制約のあるシナリオにおける限界が浮き彫りになった。
  • パッチサイズが3×30で1×15のオーバーラップをとった設定が最良の性能を示し、より小さいまたはより大きな構成を上回った。
  • 6層の浅いトランスフォーマー(92次元の埋め込み)が最高のAUC(98.77%)を達成した。これは、深さが幅よりも重要であることを示唆している。
  • 顔面および背景MSTmapsに分離されたスーパービジョンを適用した2本のブランチアーキテクチャは、入力を連結した場合と比較してAUCをほぼ2%向上させた。これは、分離学習の有効性を確認するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。