Skip to main content
QUICK REVIEW

[論文レビュー] A Note on Deepfake Detection with Low-Resources

Piotr Kawa, Piotr Syga|arXiv (Cornell University)|Jun 9, 2020
Generative Adversarial Networks and Image Synthesis参考文献 18被引用数 7
ひとこと要約

本論文は、低リソース環境向けの軽量なディープフェイク検出手法を提案し、MesoNetを改善した活性化関数(特に新規のPish関数)を導入するとともに、BRISK特徴を用いたローカル特徴記述子(LFD)ベースのアプローチを提案する。LFD手法は、Equal Error Rate(EER)が0.2836、精度が72.79%、再現率が70.12%を達成した。一方、PishはMesoNetの精度を0.8689まで向上させ、高い一貫性を示し、一般消費者向けデバイスにおけるCPUベースの効率的検出を可能にした。

ABSTRACT

Deepfakes are videos that include changes, quite often substituting face of a portrayed individual with a different face using neural networks. Even though the technology gained its popularity as a carrier of jokes and parodies it raises a serious threat to ones security - via biometric impersonation or besmearing. In this paper we present two methods that allow detecting Deepfakes for a user without significant computational power. In particular, we enhance MesoNet by replacing the original activation functions allowing a nearly 1% improvement as well as increasing the consistency of the results. Moreover, we introduced and verified a new activation function - Pish that at the cost of slight time overhead allows even higher consistency. Additionally, we present a preliminary results of Deepfake detection method based on Local Feature Descriptors (LFD), that allows setting up the system even faster and without resorting to GPU computation. Our method achieved Equal Error Rate of 0.28, with both accuracy and recall exceeding 0.7.

研究の動機と目的

  • 消費用途のCPUやGPUなどの低計算リソース環境でも効率的に動作するディープフェイク検出手法の開発を目的とする。
  • Pishと呼ばれる新規関数を含む代替活性化関数を用いて、MesoNetアーキテクチャの性能と一貫性を向上させることを目的とする。
  • 深層ニューラルネットワークに依存せずに、ローカル特徴記述子(LFD)の利用、特にBRISKとORBの検証を目的とする。
  • 推論時間および学習時間を短縮しつつ、高い精度と耐障害性を維持することを目的とする。
  • 個人が動画の真正性を独立して検証できる実用的でアクセスしやすいソリューションを提供することを目的とし、特に名譽損傷やバイオメトリクススプーフィングの事例に適している。

提案手法

  • ReLUおよびLeakyReLUの代わりに代替活性化関数をMesoNetに組み込み、検出精度と一貫性を向上させた。
  • 計算オーバーヘッドを最小限に抑えるように設計された、新たな活性化関数Pishを提案した。
  • BRISKおよびORBキーポoinト記述子を用いたローカル特徴記述子(LFD)ベースの検出パイプラインを開発し、座標と角度に着目して128次元の特徴ベクトルを構築した。
  • 各フレームを16個の等しい4×4の空間ビンに分割し、各ビンに対して8ビンのヒストグラムを作成(角度に基づき)、合計で128次元のベクトルに集約した。
  • FaceForensics++データセット上で、ハイパーパramータチューニングなしでサポートベクターマシン(SVM)分類器をLFDベクトルに訓練し、性能を評価した。
  • MesoNet(GPU加速)とLFD手法(CPU専用)の間で、学習時間および推論時間を比較し、特徴抽出時間と分類時間の両方を測定した。

実験結果

リサーチクエスチョン

  • RQ1代替活性化関数は、MesoNetアーキテクチャのディープフェイク検出における精度と一貫性を向上させることができるか?
  • RQ2提案されたPish活性化関数は、標準的なReLUおよびLeakyReLUに比べ、検出性能と安定性において優れているか?
  • RQ3BRISKやORBのようなローカル特徴記述子は、深層ニューラルネットワークに依存せずに、競争力のあるディープフェイク検出性能を達成できるか?
  • RQ4特にCPU専用環境において、LFDベース手法の推論時間および学習時間はMesoNetと比較してどうなるか?
  • RQ5軽量でCPUベースのディープフェイク検出システムは、一般ユーザーが実用的に使用するに十分な精度と低EERを達成できるか?

主な発見

  • Pish活性化関数により、MesoNetのテスト精度が0.8689に向上し、ベースラインのReLU+LeakyReLU組み合わせ(0.8676)を上回り、最先端モデルに近づいた。
  • BRISK記述子を用いたLFD手法は、FaceForensics++データセット上でEqual Error Rate(EER)が0.2836、精度が72.79%、再現率が70.12%を達成した。
  • BRISKベースのLFD手法は、SURF(0.3917)に対して0.09、SIFT(0.3395)に対して0.04のEER低減を達成し、テストされた記述子の中で優れた性能を示した。
  • LFDモデルの学習はCPU上でわずか3.5分で完了した。これは、一般消費者向けGPUで30分を要するMesoNetに比べ、低リソース環境への展開に優れた効率性を示している。
  • LFD手法の推論時間は1フレームあたり0.076秒で、MesoNetの0.034秒よりわずかに長かった。主に特徴抽出のオーバーヘッド(98%)が要因であった。
  • ORBを用いたLFDアプローチでは70.59%の精度、BRISKを用いた場合は72.79%の精度を達成し、記述子の選択が検出性能に顕著な影響を与えることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。