Skip to main content
QUICK REVIEW

[論文レビュー] How Do the Hearts of Deep Fakes Beat? Deep Fake Source Detection via Interpreting Residuals with Biological Signals

Umur Aybars Çiftçi, İlke Demir|arXiv (Cornell University)|Aug 26, 2020
Digital Media Forensic Detection参考文献 51被引用数 10
ひとこと要約

本論文は、顔面領域から抽出した脈波計測(PPG)信号を用いて生成モデルの残差を解釈することで、深層偽造動画のソース検出に新たな手法を提案する。空間的・時間的PPGパターンをPPGセルに符号化し、事前学習済みの畳み込みニューラルネットワーク(CNN)で分類することで、本手法は、偽/本物検出で97.29%、生成モデルの同定で93.39%の精度を達成し、既存手法を上回るとともに、未観測の生成器に対しても検出が可能である。

ABSTRACT

Fake portrait video generation techniques have been posing a new threat to the society with photorealistic deep fakes for political propaganda, celebrity imitation, forged evidences, and other identity related manipulations. Following these generation techniques, some detection approaches have also been proved useful due to their high classification accuracy. Nevertheless, almost no effort was spent to track down the source of deep fakes. We propose an approach not only to separate deep fakes from real videos, but also to discover the specific generative model behind a deep fake. Some pure deep learning based approaches try to classify deep fakes using CNNs where they actually learn the residuals of the generator. We believe that these residuals contain more information and we can reveal these manipulation artifacts by disentangling them with biological signals. Our key observation yields that the spatiotemporal patterns in biological signals can be conceived as a representative projection of residuals. To justify this observation, we extract PPG cells from real and fake videos and feed these to a state-of-the-art classification network for detecting the generative model per video. Our results indicate that our approach can detect fake videos with 97.29% accuracy, and the source model with 93.39% accuracy.

研究の動機と目的

  • 本物かどうかを検出するのではなく、どの生成モデルが動画を生成したかを特定するという、深層偽造検出における重要なギャップを埋めること。
  • 脈波計測(PPG)などの生物学的信号が、生成モデルの残差を解釈可能なプロキシとして機能するかどうかを検討すること。
  • 実行効率が高く、一般化性能に優れた検出フレームワークを構築し、本物性とソース分類の両方を向上させること。
  • 生物学的信号空間における一意な残差シグネチャを学習することで、これまでにない生成モデルが生成した偽造動画の検出を可能にすること。

提案手法

  • 動画フレームの連続から顔面領域における32本の原始的PPG信号を抽出し、血流や脈拍に関連する動脈血流変化を捉える。
  • 顔面領域と時間窓におけるPPG信号の振幅およびスペクトル密度を符号化することで、空間的・時間的PPGセルを構築する。
  • 事前学習済みの深層ニューラルネットワーク(例:VGG19、DenseNet201)にPPGセルを入力し、動画のソース生成モデルを分類する。
  • 動画窓全体にわたるフレームレベルの予測を平均ログオッズで集約し、最終的な動画単位の分類を出力する。
  • データオーグメンテーションを適用し、FaceForensics++データセットで学習を行い、ソース同定のための多値交差エントロピー損失関数を用いる。
  • アブレーションスタディを実施し、UADFV、CelebDF、DeepFakeDatasetといった未観測データセットを用いた一般化評価により、未知の生成器に対する耐性を検証する。

実験結果

リサーチクエスチョン

  • RQ1脈波計測(PPG)のような生物学的信号が、深層偽造動画における生成モデル固有の残差を信頼できるプロキシとして機能するか。
  • RQ2生理的信号の観点から残差を解釈することで、偽/本物検出およびソース同定の両方の精度が向上するか。
  • RQ3提案手法が、これまでにないもしくは未知の生成モデルによって生成された偽造動画を検出できるか。
  • RQ4フレームベースや顔領域ROIベースの分類と比較して、PPG信号の導入が精度および計算効率に与える影響は何か。

主な発見

  • 提案手法は、FaceForensics++データセットにおいて、本物/偽物分類で97.29%の精度を達成し、フレームベースのベースラインを顕著に上回った。
  • 4種類の深層偽造生成モデルと本物動画のうち、ソース生成モデルを同定する精度が93.39%に達し、強力なソース識別性能を示した。
  • 1つのGPUで100エポックあたりの学習時間を29時間からわずか2時間35分に短縮し、フレームベース手法と比較して極めて効率的であることがわかった。
  • UADFVやCelebDFといった未観測データセットでテストした結果、本物動画の93.61%、偽造動画の95.83%を正しく分類し、未知の生成器に対する耐性が確認された。
  • 学習時に本物クラスを除外することで、環境由来のアーチファクトに起因するノイズを低減し、ソース検出精度が向上した。これは、本物動画がPPG空間において「混沌とした」性質を有することを裏付けた。
  • VGG19やDenseNet201といった異なるバックボーンアーキテクチャにわたり、本手法は一般化性能に優れ、Xceptionのような複雑なアーキテクチャを10%以上上回る精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。