[論文レビュー] Restricted Black-box Adversarial Attack Against DeepFake Face Swapping
本稿では、ターゲットモデルのクエリを一切行わず、DeepFake顔交換システムを破壊するための制限付きブラックボックス敵対的攻撃を提案する。新たなTCA-GANフレームワークを用いてサブスティチュートモデルを訓練し、その後の正則化を施すことにより、顔交換出力が著しく歪められ、他の顔操作モデルに対しても強い汎化性を示しながら、検出精度が著しく低下する。
DeepFake face swapping presents a significant threat to online security and social media, which can replace the source face in an arbitrary photo/video with the target face of an entirely different person. In order to prevent this fraud, some researchers have begun to study the adversarial methods against DeepFake or face manipulation. However, existing works focus on the white-box setting or the black-box setting driven by abundant queries, which severely limits the practical application of these methods. To tackle this problem, we introduce a practical adversarial attack that does not require any queries to the facial image forgery model. Our method is built on a substitute model persuing for face reconstruction and then transfers adversarial examples from the substitute model directly to inaccessible black-box DeepFake models. Specially, we propose the Transferable Cycle Adversary Generative Adversarial Network (TCA-GAN) to construct the adversarial perturbation for disrupting unknown DeepFake systems. We also present a novel post-regularization module for enhancing the transferability of generated adversarial examples. To comprehensively measure the effectiveness of our approaches, we construct a challenging benchmark of DeepFake adversarial attacks for future development. Extensive experiments impressively show that the proposed adversarial attack method makes the visual quality of DeepFake face images plummet so that they are easier to be detected by humans and algorithms. Moreover, we demonstrate that the proposed algorithm can be generalized to offer face image protection against various face translation methods.
研究の動機と目的
- 既存のDeepFake顔交換に対する敵対的攻撃がホワイトボックスアクセスや多数のクエリに依存するという実用的制限を解消すること。
- ターゲットモデルへのクエリが一切不要な制限付きブラックボックス攻撃を構築し、実世界への適用可能性を確保すること。
- 新規の生成フレームワークと事後正則化を用いて、未知のDeepFakeモデルへ高い転送性を持つ敵対的例を向上させること。
- 今後の研究のための、DeepFake顔交換に対する敵対的攻撃を評価するベンチマークデータセットを構築すること。
- 敵対的歪みが既存のDeepFake検出手法の性能を向上させることを実証すること。
提案手法
- 攻撃と防御をサイクル整合的に行うことで、敵対的摂動を生成するための転送可能なサイクルアドバーシャー生成的敵対的ネットワーク(TCA-GAN)を提案する。
- 深層オートエンコーダーに基づくサブスティチュートモデルを訓練し、未知のDeepFakeモデルの挙動を模倣することで、顔を再構築する。
- 敵対的例はサブスティチュートモデル上で生成され、ターゲットブラックボックスモデルへ直接転送され、いかなるクエリも不要となる。
- 生成された敵対的例に、新たな事後正則化モジュールを適用し、多様な顔操作システム間での転送性と耐性を向上させる。
- 歪みの程度を測定するために、参照あり(SSIM、FSIM)および参照なし(BRISQUE)の画像品質指標を用いて評価する。
- 本手法は、StarGAN、GANImation、SaGAN、AttGANなど、他の顔変換モデルに対しても効果的に汎化でき、一貫した視覚的歪みを示した。

実験結果
リサーチクエスチョン
- RQ1ターゲットDeepFakeモデルに対して一切クエリが許可されない状況下で、制限付きブラックボックス敵対的攻撃が有効に機能するか。
- RQ2未知のDeepFake顔交換モデルへ高い転送性を持つ敵対的摂動をどのように実現できるか。
- RQ3敵対的歪みが顔交換画像の視覚的品質を著しく損なうことで、検出性能の向上が図れるか。
- RQ4提案手法は、DeepFake顔交換を越えて、他の顔操作モデルへどの程度汎化可能か。
- RQ5事後正則化は、制限付きブラックボックス環境下で敵対的例の転送性と耐性を向上させるか。
主な発見
- 提案手法により、顔交換画像のSSIMが最小0.591まで低下し、BRISQUEスコアが49.51まで上昇し、著しい視覚的歪みが生じた。
- 提案されたベンチマークにおいて、敵対的例は顔交換画像の検出精度をXceptionでは67.1%から71.4%へ、CNNDetectionでは78.3%から79.7%へと低下させ、検出可能性の向上が明確に示された。
- 本手法は、StarGAN、GANImation、SaGAN、AttGANなど、他の顔変換モデルに対しても効果的に汎化し、すべてのモデルで一貫した視覚的劣化を引き起こした。
- 事後正則化により、敵対的例の転送性が顕著に向上し、未知のターゲットモデルに対する破壊力が強化された。
- 本手法によって誘発された敵対的例は、複数のDeepFake検出モデルの性能を向上させ、防衛メカニズムとしての有効性を示した。
- モデル勾配やクエリを一切必要とせず、強い視覚的歪みを実現した。これは、実用的な制限付きブラックボックス状況下での有効性を裏付けた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。