Skip to main content
QUICK REVIEW

[論文レビュー] Two-stream Convolutional Networks for Multi-frame Face Anti-spoofing

Zhuoyi Zhang, Cheng Jiang|arXiv (Cornell University)|Aug 9, 2021
Biometric Identification and Security参考文献 34被引用数 4
ひとこと要約

本論文は、マルチフレームRGB入力とRGB差分画像を活用して補完的な空間的・時間的特徴を捉える、軽量な2ストリーム畳み込みニューラルネットワークを提案する。特徴ピラミッドモジュールと逆方向融合を組み合わせ、ピラミッドプーリングモジュールを統合することで、パrameter数を著しく削減しながらも、複数のベンチマークで最先端の性能を達成し、精度と効率の両面で既存手法を上回った。

ABSTRACT

Face anti-spoofing is an important task to protect the security of face recognition. Most of previous work either struggle to capture discriminative and generalizable feature or rely on auxiliary information which is unavailable for most of industrial product. Inspired by the video classification work, we propose an efficient two-stream model to capture the key differences between live and spoof faces, which takes multi-frames and RGB difference as input respectively. Feature pyramid modules with two opposite fusion directions and pyramid pooling modules are applied to enhance feature representation. We evaluate the proposed method on the datasets of Siw, Oulu-NPU, CASIA-MFSD and Replay-Attack. The results show that our model achieves the state-of-the-art results on most of datasets' protocol with much less parameter size.

研究の動機と目的

  • 実世界の顔認識システムにおいて、印刷物やリプレイ攻撃などのスプーフィング攻撃(偽物)と生顔を区別する課題に対処すること。
  • 深度や赤外線データといった補助データに依存しない、軽量で効率的なモデルの開発。工業的応用ではこれらのデータがしばしば入手不可能であるため。
  • 複数フレームの動画から微細な動きの手がかりと、強固な空間的パターンを捉えることで、特徴表現を向上させること。
  • RGB画像における顔の外見特徴の重複による過学習を、RGB差分入力とアテンション機構の活用により低減すること。

提案手法

  • モデルは2ストリームアーキテクチャを採用。1本目のストリームは、逆方向特徴ピラミッドモジュール(FPM)とピラミッドプーリングモジュール(PPM)を備えたCNN-LSTMバックボーンを用いて、マルチフレームRGB入力を処理する。
  • 2本目のストリームは、連続フレーム間の画素単位の差分として計算されるRGB差分画像を処理し、動きや時間的ダイナミクスを強調するとともに、顔の外見に依存する過学習を低減する。
  • 逆方向融合を有する特徴ピラミッドモジュールは、多スケール特徴学習を強化し、微細な動きと構造的アーチファクトの両方の表現を向上させる。
  • ピラミッドプーリングモジュールは、顔のサイズやポーズの変化に強い特徴の集約を実現し、ロバストネスを向上させる。
  • ブランチ監視戦略では、RGB差分ブランチから得られる空間的アテンションマスクを用いて、マルチフレームブランチの特徴学習をガイドするが、実験ではこの統合による利益は限定的であった。
  • 最終的な予測は、両ブランチのスコア出力を連結して分類することで行われ、それぞれの相補的な強みを組み合わせる。

実験結果

リサーチクエスチョン

  • RQ12ストリームCNNアーキテクチャは、マルチフレームRGB入力とRGB差分入力を効果的に活用することで、顔のスプーフィング検出性能を向上させることができるか?
  • RQ2逆方向融合を持つ特徴ピラミッドモジュールは、リソースが限られた環境下で、空間的・時間的特徴学習をどのように向上させるか?
  • RQ3RGB差分画像を入力として用いることで、顔の外見に依存する過学習はどの程度低減され、スプーフィングに関連する動きの手がかりは保持されるか?
  • RQ4ピラミッドプーリングと特徴ピラミッドモジュールの統合は、多様なスプーフィング検出プロトコルにわたる一般化性能を向上させるか?
  • RQ5補助データ(深度や赤外線)に依存しない軽量モデルが、最先端の性能を達成できるか?

主な発見

  • 提案された2ストリームモデルは、SiW、Oulu-NPU、CASIA-MFSD、Replay-Attackデータセットの多数のプロトコルで最先端の性能を達成し、クロステスト下でのSiWデータセットではACERが1.2%にまで低下した。
  • SiWデータセットではHTERが8.0%を記録し、ベースラインの単一ストリームモデル(HTER: 11.0%)や他のアブレーションバリアントを著しく上回った。
  • RGB差分画像を1本目のストリームに入力として用いることで、過学習が効果的に低減され、微細な動きアーチファクトの検出が向上し、一般化性能の向上に寄与した。
  • アブレーションスタディにおいて、スタイル変換およびノイズ除去手法はクロステスト下での性能向上をもたらしたが、パrameter数の増加を伴い、精度と効率のトレードオフを示した。
  • ブランチ監視戦略は、相互にアテンションを介した特徴学習の向上を意図したものであったが、性能向上をもたらさなかった。これは、相補的特徴の独立学習がより効果的であることを示唆している。
  • モデルのコンactな設計(修正されたMobileNetV3-Smallバックボーンを採用)により、従来の最先端手法と比較して顕著に少ないパrameter数で高い精度を達成し、産業用途への展開に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。