Skip to main content
QUICK REVIEW

[論文レビュー] Swapped Face Detection using Deep Learning and Subjective Assessment

Xinyi Ding, Zohreh Raziei|arXiv (Cornell University)|Sep 10, 2019
Face recognition and analysis参考文献 24被引用数 7
ひとこと要約

本稿では、深層転移学習に基づく顔交換検出モデルを提案し、低誤報率で96%を超える真陽性率を達成するとともに、ログチス差を用いた不確実性推定を導入することで信頼性を向上させた。また、独自のウェブサイトを用いて人間による対比較を実施し、モデルの不確実性と人間のリアルさの認識の間に強い相関(r > 0.75)が確認された。さらに、これまでで最大の公開静止画像顔交換データセットをリリースした。

ABSTRACT

The tremendous success of deep learning for imaging applications has resulted in numerous beneficial advances. Unfortunately, this success has also been a catalyst for malicious uses such as photo-realistic face swapping of parties without consent. Transferring one person's face from a source image to a target image of another person, while keeping the image photo-realistic overall has become increasingly easy and automatic, even for individuals without much knowledge of image processing. In this study, we use deep transfer learning for face swapping detection, showing true positive rates >96% with very few false alarms. Distinguished from existing methods that only provide detection accuracy, we also provide uncertainty for each prediction, which is critical for trust in the deployment of such detection systems. Moreover, we provide a comparison to human subjects. To capture human recognition performance, we build a website to collect pairwise comparisons of images from human subjects. Based on these comparisons, images are ranked from most real to most fake. We compare this ranking to the outputs from our automatic model, showing good, but imperfect, correspondence with linear correlations >0.75. Overall, the results show the effectiveness of our method. As part of this study, we create a novel, publicly available dataset that is, to the best of our knowledge, the largest public swapped face dataset created using still images. Our goal of this study is to inspire more research in the field of image forensics through the creation of a public dataset and initial analysis.

研究の動機と目的

  • 実世界での導入における信頼性を高めるために、不確実性推定を備えた信頼性の高い深層学習ベースの顔交換検出システムの開発。
  • 人間の認識と比較してモデルの性能を評価するため、被験者からの画像対比較データを収集する。
  • 86人の有名人を対象に420,053枚の画像を含む、これまでで最大の公開静止画像顔交換データセットの作成およびリリース。
  • モデルの予測と人間の順位付けを比較し、偽物顔を検出する際のモデルの直感との整合性を評価する。
  • ベンチマークデータセットと比較分析を提供することで、画像フォレンジックス分野におけるさらなる研究を促進する。

提案手法

  • 大規模な顔交換データセットで微調整された事前学習済みResNet-50モデルを用いた転移学習により、本物対偽物顔の二値分類を実行する。
  • 出力クラス間のログチス差(オッズ比)を用いて予測の不確実性を推定し、差が小さいほど信頼度が低いと仮定する。
  • 400枚の画像を対象に、独自のウェブサイトを用いて人間による対比較を実施し、最も本物に近いものから最も偽物に近いものへの人間の認識順位を生成する。
  • 近似順位付けアルゴリズム(Hamming-LUCB)を適用し、正確性を維持しつつ必要な対比較回数を削減する。
  • Grad-CAMを用いて注目マップを可視化し、モデルが鼻や目といった顔の領域に注目していることが確認され、人間の視線と整合的である。
  • 線形相関およびスピアマン順位相関を用いて、モデルのログチスマージン(不確実性)と人間の順位付けの類似性を評価する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは人間の認識と比較して、どれほど顔交換を検出できるか?
  • RQ2ログチス差によるモデルの不確実性推定は、人間が偽物顔を検出するのが難しいと感じた場合と相関するか?
  • RQ3モデルによる顔画像の順位付けと、人間による対比較から得られた順位付けとの類似度はどの程度か?
  • RQ4大規模かつ多様なデータセット上でのモデルの真陽性率および誤報率の性能はどの程度か?
  • RQ5モデルの注目領域が、人間の顔の特徴に対する視線とどの程度一致するか?

主な発見

  • 提案されたモデルは、非常に少ない誤報率を伴いながら96%を超える真陽性率を達成し、高い検出精度を示した。
  • ログチス差に基づくモデルの不確実性推定は、人間の認識と強く相関しており、AE-GANおよびNirkin法で生成された顔に対して線形相関 >0.75、スピアマン順位相関 >0.75の結果が得られた。
  • AE-GAN法の場合は、モデルのログチスマージンと人間の順位付けとの間で線形相関が0.8332であり、Nirkin法では0.7896であった。両者ともp値 < 0.01であった。
  • 被験者は、Nirkin法で生成された顔(より写真的で高解像度)の検出に、AE-GAN法で生成されたぼやけた顔よりも困難を感じていた。
  • Grad-CAMの可視化により、モデルが顔の中心部(鼻と目)に注目していることが確認され、人間の注視パターンと一致しており、アーチファクトが集中する可能性の高い領域と一致している。
  • 本研究では、86人の有名人を対象に420,053枚の画像を含む、これまでで最大の公開静止画像顔交換データセットをリリースした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。