Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Deepfakes with Self-Blended Images

Kaede Shiohara, Toshihiko Yamasaki|arXiv (Cornell University)|Apr 18, 2022
Digital Media Forensic Detection被引用数 8
ひとこと要約

本稿では、深伪造検出のための合成学習データ手法として、自己ブレンドド画像(SBIs)を提案する。SBIsは、1枚の実画像をわずかに変換したバージョンをブレンドすることで、検出が難しい偽物のサンプルを生成する。ブレンド境界や色の不一致といった一般的な改ざんアーティファクトを模倣することで、モデルの一般化性能が向上し、SOTA(最先端)の性能を達成した。クロスデータセット評価において、DFDCでは先行手法を4.90%、DFDCPでは11.78%上回った。

ABSTRACT

In this paper, we present novel synthetic training data called self-blended images (SBIs) to detect deepfakes. SBIs are generated by blending pseudo source and target images from single pristine images, reproducing common forgery artifacts (e.g., blending boundaries and statistical inconsistencies between source and target images). The key idea behind SBIs is that more general and hardly recognizable fake samples encourage classifiers to learn generic and robust representations without overfitting to manipulation-specific artifacts. We compare our approach with state-of-the-art methods on FF++, CDF, DFD, DFDC, DFDCP, and FFIW datasets by following the standard cross-dataset and cross-manipulation protocols. Extensive experiments show that our method improves the model generalization to unknown manipulations and scenes. In particular, on DFDC and DFDCP where existing methods suffer from the domain gap between the training and test sets, our approach outperforms the baseline by 4.90% and 11.78% points in the cross-dataset evaluation, respectively.

研究の動機と目的

  • 未学習の改ざんやデータセットに対してモデルが失敗する、クロスデータセットおよびクロス改ざんシナリオにおける深伪造検出の一般化の課題に対処すること。
  • 異なる2枚の実画像のペアに依存する従来の合成データ生成手法の限界、および高圧縮・低品質なデータセットでは機能しない問題を克服すること。
  • 高価なランドマーク一致処理や大規模データ処理を必要とせず、多様でアーティファクト豊富な偽物サンプルを計算的に効率的に生成する手法を開発すること。
  • 改ざん固有のアーティファクトではなく、微細で一般的な改ざんの兆候に注目することで、汎用的で頑健な表現を学習する深伪造検出器を訓練すること。

提案手法

  • SBIsは、1枚の綺麗な画像に画像変換(例:色ずれ、シャープネス、リサイズ、平行移動)を適用して擬似ソース画像とターゲット画像を生成することで作成される。
  • マスク生成器は顔のランドマークを用いて多様なブレンドマスクを生成し、それをソース画像とターゲット画像に適用して1枚のSBIに統合する。
  • ソース・ターゲット生成器(STG)とマスク生成器(MG)は独立して動作するため、従来手法で必要とされる計算コストの高い最近傍ランドマーク検索が不要になる。
  • 本手法は、ブレンド境界、ランドマークの不一致、色の不一致、周波数ドメインの異常といった改ざんアーティファクトを能動的に生成する。
  • SBIsは、実際の改ざん画像を必要とせず、合成データのみでエンドツーエンドの訓練が可能であり、深伪造検出器の訓練に利用できる。
  • 本手法は、特定の改ざんスタイルに過学習するのを避け、汎用的で検出が難しいアーティファクトに注目することで、訓練効率を向上させ、モデルの頑健性を高める。

実験結果

リサーチクエスチョン

  • RQ1汎用的で検出が難しい改ざんアーティファクトに注目した合成学習データは、未学習のデータセットや改ざんタイプに対し、深伪造検出の一般化性能を向上させることができるか?
  • RQ2異なる実画像ペアに依存する既存の手法と比較して、自己ブレンドド画像生成はどのように異なるか?
  • RQ3ランドマークに基づくソース選択が欠落することで、訓練効率とモデルの頑健性はどの程度向上するか?
  • RQ41枚の画像からアーティファクトを生成することで、複数の実画像を用いる手法に比べ、より良い表現学習が達成できるか?
  • RQ5SBIsはFaceSwap、FOMA、Neural Texture Transferといった未学習の改ざん技術に対しても一般化可能か?

主な発見

  • DFDCデータセットでは、クロスデータセット評価において、提案手法が最先端の非教師ありベースラインを4.90%上回った。
  • より困難なDFDCPデータセットでは、同じベースラインをクロスデータセット評価で11.78%上回り、強力なドメイン一般化性能を示した。
  • クロス改ざん評価において、未学習の改ざんタイプ(DF, F2F, FS, NT)でAUCスコアが99.99%、99.88%、99.91%、98.79%を達成した。
  • FF++全評価では、99.64%のAUCを達成し、訓練セットでモデルが飽和しているにもかかわらず、先行SOTA(99.11%)を上回った。
  • BI(ブレンドド画像)と jointly トレーニングすると、SBIs単体よりも性能が低下した。これは、SBIsが一般化により効果的であることを示している。
  • BIにソース・ターゲット増強を適用することで性能は向上したが、依然としてSBIsに劣り、自己ブレンドと二重増強の両方が重要であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。