Skip to main content
QUICK REVIEW

[論文レビュー] Adversarially robust deepfake media detection using fused convolutional neural network predictions

Sohail Ahmed Khan, Alessandro Artusi|arXiv (Cornell University)|Feb 11, 2021
Adversarial Robustness in Machine Learning参考文献 18被引用数 13
ひとこと要約

本論文は、VGG16、InceptionV3、XceptionNetを統合した統合畳み込みニューラルネットワーク(CNN)アンサンブルを提案し、深層偽造検出における敵対的ロバスト性と一般化性能を向上させる。融合モデルはDFDCテストセットで96.5%の精度を達成し、低品質なDeepFake-TIMITデータセットでは99%の精度を示す。予測投票の集団的特性により、敵対的攻撃に対する耐性が向上している。

ABSTRACT

Deepfakes are synthetically generated images, videos or audios, which fraudsters use to manipulate legitimate information. Current deepfake detection systems struggle against unseen data. To address this, we employ three different deep Convolutional Neural Network (CNN) models, (1) VGG16, (2) InceptionV3, and (3) XceptionNet to classify fake and real images extracted from videos. We also constructed a fusion of the deep CNN models to improve the robustness and generalisation capability. The proposed technique outperforms state-of-the-art models with 96.5% accuracy, when tested on publicly available DeepFake Detection Challenge (DFDC) test data, comprising of 400 videos. The fusion model achieves 99% accuracy on lower quality DeepFake-TIMIT dataset videos and 91.88% on higher quality DeepFake-TIMIT videos. In addition to this, we prove that prediction fusion is more robust against adversarial attacks. If one model is compromised by an adversarial attack, the prediction fusion does not let it affect the overall classification.

研究の動機と目的

  • 未観測および敵対的データに対する深層偽造検出モデルの脆弱性を解消すること。
  • 単一モデルの限界を超えて、深層偽造検出システムの一般化性能とロバスト性を向上させること。
  • 検出性能を向上させつつ、敵対的摂動に対して耐性を保つ融合戦略を開発すること。
  • DFDCおよびDeepFake-TIMITを含む多様なベンチマークデータセット上で、さまざまな動画品質条件下での提案手法の評価を行うこと。

提案手法

  • 動画から抽出した偽造画像フレームと本物画像フレームを用いて、事前学習済みのCNNアーキテクチャ(VGG16、InceptionV3、XceptionNet)を訓練した。
  • 3つのモデルの最終分類予測を重み付き平均または投票手法で統合し、意思決定のロバスト性を向上させた。
  • 特徴レベルおよび予測レベルの統合を採用し、任意の1つのモデルの予測に依存するのを低減した。
  • 敵対的訓練を実施し、個々のモデルに対して標的攻撃をシミュレートすることで、システム全体の耐性を評価した。
  • 一般化性能を向上させるために、訓練中に早期停止とデータ拡張を適用した。
  • DFDCおよびDeepFake-TIMITベンチマークを含む複数のデータセット上で、さまざまな画像品質条件下での統合性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1複数の深層CNNのアンサンブル統合は、未観測の深層偽造データに対する検出精度とロバスト性を向上させることができるか?
  • RQ2予測レベルの統合は、個々のモデルと比較して、敵対的攻撃に対する耐性をどのように向上させるか?
  • RQ3DeepFake-TIMITのような低品質および高品質の深層偽造データセットにおける統合モデルの性能はいかがなものか?
  • RQ4融合アプローチは、モデル固有の敵対的摂動に対する感受性を低下させつつ、高い精度を維持できるか?
  • RQ5一般化性能とロバスト性の観点から、最先端の単一モデル型深層偽造検出器と比較して、アンサンブル手法はどのように優れているか?

主な発見

  • 統合CNNモデルは、公開のDFDCテストセットで96.5%の精度を達成し、最先端のモデルを上回った。
  • 低品質なDeepFake-TIMITデータセットでは、統合モデルが99%の精度を達成し、劣化した入力でも優れた性能を示した。
  • 高品質なDeepFake-TIMIT動画では、モデルが91.88%の精度を達成し、品質レベルにかかわらず一貫した性能を示した。
  • 予測統合により、敵対的攻撃に対する耐性が顕著に向上し、1つのモデルが損なわれても全体の分類性能が著しく低下しなかった。
  • アンサンブルアプローチにより、モデル固有の脆弱性が軽減され、集団的意思決定が敵対的条件下での信頼性を高めることを示した。
  • 個々のモデルが標的の敵対的摂動にさらされても、融合機構は高い精度を維持した。これは、その耐性が確認されたことを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。