[論文レビュー] OGAN: Disrupting Deepfakes with an Adversarial Attack that Survives Training
本論文では、二重最適化フレームワークを用いて空間的・時間的歪みを注入することで、顔交換ディープフェイクを破壊する訓練に耐性のある敵対的攻撃OGANを提案する。この手法は、攻撃サンプルがターゲットモデルの学習データに含まれる場合でさえも、持続的な敵対的摂動を生成し、それらが学習データに含まれる状況下でも、従来の攻撃(歪み攻撃)を上回る性能を示す。
Recent advances in autoencoders and generative models have given rise to effective video forgery methods, used for generating so-called "deepfakes". Mitigation research is mostly focused on post-factum deepfake detection and not on prevention. We complement these efforts by introducing a novel class of adversarial attacks---training-resistant attacks---which can disrupt face-swapping autoencoders whether or not its adversarial images have been included in the training set of said autoencoders. We propose the Oscillating GAN (OGAN) attack, a novel attack optimized to be training-resistant, which introduces spatial-temporal distortions to the output of face-swapping autoencoders. To implement OGAN, we construct a bilevel optimization problem, where we train a generator and a face-swapping model instance against each other. Specifically, we pair each input image with a target distortion, and feed them into a generator that produces an adversarial image. This image will exhibit the distortion when a face-swapping autoencoder is applied to it. We solve the optimization problem by training the generator and the face-swapping model simultaneously using an iterative process of alternating optimization. Next, we analyze the previously published Distorting Attack and show it is training-resistant, though it is outperformed by our suggested OGAN. Finally, we validate both attacks using a popular implementation of FaceSwap, and show that they transfer across different target models and target faces, including faces the adversarial attacks were not trained on. More broadly, these results demonstrate the existence of training-resistant adversarial attacks, potentially applicable to a wide range of domains.
研究の動機と目的
- 従来のディープフェイクに対する敵対的攻撃には、攻撃に使われた敵対的サンプルが学習データに含まれる場合に機能しないため、その制限を解消すること。
- 敵対的サンプルがモデルの学習データに含まれるかどうかにかかわらず、依然として効果を発揮する「訓練に耐性のある攻撃」としての新規クラスの敵対的攻撃を開発すること。
- 再学習時に敵対的データを用いる場合にも耐性を持つように最適化された、新規の攻撃手法OGANの設計と評価を行うこと。
- OGANと従来の歪み攻撃の有効性を、複数の顔交換モデルおよび攻撃訓練時に見られなかったターゲット顔に対して検証すること。
- 延長された学習下でも、ディープフェイク出力における歪みの転送性と持続性を示すこと。
提案手法
- 生成器と顔交換オートエンコーダーが互いに敵対的に学習する二重最適化問題として攻撃を定式化する。
- 生成器が、顔交換モデルによって処理された際に顕著な空間的・時間的歪みを引き起こす敵対的画像を生成するように訓練する。
- 交互最適化を用いて、生成器とターゲットの顔交換モデルを繰り返し更新し、現実世界の敵対的ダイナミクスを模倣する。
- 顔交換モデルの出力に破壊的歪みを誘発することを最優先とする損失関数を生成器に導入する。
- FaceSwapなどの一般的な顔交換実装に対して、エンドツーエンドで攻撃を適用し、転送性と耐性を評価する。
- 空間的・時間的歪みスコア($S_{tmp}$)と知覚誤差($E_{tmp}$)を用いて、ディープフェイク出力の成功度を測定する。
実験結果
リサーチクエスチョン
- RQ1攻撃に使われた敵対的サンプルが学習データに含まれる場合でも、敵対的攻撃は効果を保つことができるか?
- RQ2敵対的サンプルが学習データに含まれる状況下で、OGAN攻撃は従来の歪み攻撃と比べてどの程度耐性を示すか?
- RQ3これらの攻撃は、攻撃訓練時に確認されていない異なる顔交換モデルやターゲットアイデンティティへどの程度転送可能か?
- RQ4ターゲットモデルの長期間の学習が、敵対的攻撃によって導入された歪みの持続性にどのように影響するか?
- RQ5訓練に耐性のある敵対的攻撃は、顔交換オートエンコーダー以外の生成モデルに対しても一般化可能か?
主な発見
- OGANは、敵対的データ上で500,000イテレーションの学習後でも高い空間的・時間的歪みスコア($S_{tmp} = 0.054$)を維持し、強力な訓練耐性を示している。
- 歪み攻撃も訓練耐性を示し、敵対的データ上で500,000イテレーションの学習後、$S_{tmp} = 0.021$を達成したが、OGANに劣る性能であった。
- 敵対的サンプルが学習から除外された場合でも、OGANは顕著な$S_{tmp}$スコアを達成しており、訓練固有の最適化がなくても依然として効果的であることが示された。
- OGANと歪み攻撃の両方が、攻撃訓練時に確認されていないターゲット顔や異なる顔交換モデル(dfl-h128、dfl-sae、realfaceなど)へも効果的に転送された。
- 空間的・時間的歪みスコア($S_{tmp}$)は約300,000イテレーション後に安定化し、長期間の学習にもかかわらず持続的な破壊的影響が確認された。
- 可視化分析により、歪みがディープフェイク動画において顕著な振動として現れ、人間の目で操作が検出可能であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。