Skip to main content
QUICK REVIEW

[論文レビュー] Vulnerability of Face Recognition to Deep Morphing

Pavel Korshunov, Sébastien Marcel|arXiv (Cornell University)|Oct 3, 2019
Face recognition and analysis参考文献 22被引用数 13
ひとこと要約

本論文は、最先端の顔認識システム(VGGおよびFaceNet)がGANによって生成されたデュアルモーフ動画に対してどれほど脆弱であるかを評価し、それぞれ85.62%および95.00%の誤認証率を示した。本研究ではDeepfakeTIMITデータセットを提案し、画像品質指標ベースの検出法にSVMを適用した場合、高品質なデュアルモーフ動画において等誤差率(EER)が8.97%に達することを示した。これは、高度な検出手法の開発が急務であることを示している。

ABSTRACT

It is increasingly easy to automatically swap faces in images and video or morph two faces into one using generative adversarial networks (GANs). The high quality of the resulted deep-morph raises the question of how vulnerable the current face recognition systems are to such fake images and videos. It also calls for automated ways to detect these GAN-generated faces. In this paper, we present the publicly available dataset of the Deepfake videos with faces morphed with a GAN-based algorithm. To generate these videos, we used open source software based on GANs, and we emphasize that training and blending parameters can significantly impact the quality of the resulted videos. We show that the state of the art face recognition systems based on VGG and Facenet neural networks are vulnerable to the deep morph videos, with 85.62 and 95.00 false acceptance rates, respectively, which means methods for detecting these videos are necessary. We consider several baseline approaches for detecting deep morphs and find that the method based on visual quality metrics (often used in presentation attack detection domain) leads to the best performance with 8.97 equal error rate. Our experiments demonstrate that GAN-generated deep morph videos are challenging for both face recognition systems and existing detection methods, and the further development of deep morphing technologies will make it even more so.

研究の動機と目的

  • 最先端の顔認識システムがGANベースのデュアルモーフ動画に対してどれほど脆弱であるかを評価すること。
  • プレゼンテーションアタック検出分野で既存の検出手法がデュアルモーフ動画を効果的に検出できるかを評価すること。
  • 再現可能で標準化された研究とベンチマークに利用可能な、デュアルモーフ動画の公開データセットを提供すること。
  • 高品質なGANで生成された顔の入れ替えが、現在の顔認識システムを高い成功率で回避できることを実証すること。
  • ますますリアルな合成メディアに対応できる、より強固な検出技術の開発を促すこと。

提案手法

  • VidTIMITデータセットから外見が似た16組の人物を選び、オープンソースのGANベースの顔交換ツール(faceswap-GAN)を用いてデュアルモーフ動画を生成した。
  • 低品質(64×64)と高品質(128×128)の2つの動画品質レベルを設定し、合計620本の動画(各品質レベル320本)を生成した。
  • 元の音声トラックを保持することで、顔認識および検出に与える視覚的改ざんの影響を明確に分離した。
  • 事前学習済みのVGGおよびFaceNetモデルを用いて顔認識性能を評価し、それぞれfc7およびボトルネック層から特徴量を抽出し、コサイン類似度を用いて照合した。
  • ベースライン検出手法として、ピixeリング+PCA+LDA、IQM+PCA+LDA、IQM+SVMを適用し、129種類の画像品質指標(例:ぼやけ具合、SNR、反射光)を用いた。
  • ホールドアウトされたテストセットを用いて、等誤差率(EER)および10%のFARにおけるFRRを報告した。データセットサイズの制限により開発セットを用意しなかった。

実験結果

リサーチクエスチョン

  • RQ1最先端の顔認識システム(VGGおよびFaceNet)は、GANで生成されたデュアルモーフ動画に対してどれほど脆弱であるか?
  • RQ2既存のプレゼンテーションアタック検出技術は、デュアルモーフ動画を効果的に検出できるか?
  • RQ3GANで生成されたデュアルモーフ動画の品質(低品質対高品質)が検出性能に与える影響は何か?
  • RQ4画像品質指標ベースの検出システムは、本物の顔とデュアルモーフをどれほど正確に区別できるか?
  • RQ5GANで生成された顔のリアルさは、現在の顔認識および検出パイプラインにどの程度の挑戦をもたらすか?

主な発見

  • VGGベースの顔認識では、高品質なデュアルモーフ動画に対して85.62%の誤認証率(FAR)を示し、顕著な脆弱性を示した。
  • FaceNetベースの認識では、高品質なデュアルモーフに対して95.00%のFARを示し、より高度なモデルであっても合成顔に対して必ずしも堅牢ではないことを示した。
  • IQM+SVM検出手法は、高品質なデュアルモーフ動画において等誤差率(EER)が8.97%に達し、他のベースラインを上回った。
  • IQM+SVM手法は、高品質なデュアルモーフに対して10%のFARにおけるFRRが9.05%にとどまり、非常に高い検出能力を示したが、高品質な合成の影響を受けても依然として優れた性能を発揮した。
  • 検出システムの性能は、高品質なデュアルモーフに対して著しく低下した。これは、今後のGAN技術の進展が、既存の検出手法をさらに困難にする可能性を示している。
  • 本研究の結果は、GANで生成されたデュアルモーフが顔認識システムを効果的に回避できることを示しており、新たな検出戦略とデータセットの開発が不可欠であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。