Skip to main content
QUICK REVIEW

[論文レビュー] Defending against GAN-based Deepfake Attacks via Transformation-aware Adversarial Faces

Chaofei Yang, Lei Ding|arXiv (Cornell University)|Jun 12, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用数 5
ひとこと要約

本稿では、訓練中に合成顔の品質を低下させる変換感知型 adversarial 顔を生成することにより、GANベースの Deepfake 攻撃に対する画期的な攻撃的防御を提案する。微分可能でランダムな画像変換とアンサンブル戦略を組み合わせることで、視覚的アーティファクトを誘発し、検出可能性を向上させ、白箱・ grayout・黒箱のあらゆる設定において、生成された偽顔の現実性と耐性を顕著に低下させる。

ABSTRACT

Deepfake represents a category of face-swapping attacks that leverage machine learning models such as autoencoders or generative adversarial networks. Although the concept of the face-swapping is not new, its recent technical advances make fake content (e.g., images, videos) more realistic and imperceptible to Humans. Various detection techniques for Deepfake attacks have been explored. These methods, however, are passive measures against Deepfakes as they are mitigation strategies after the high-quality fake content is generated. More importantly, we would like to think ahead of the attackers with robust defenses. This work aims to take an offensive measure to impede the generation of high-quality fake images or videos. Specifically, we propose to use novel transformation-aware adversarially perturbed faces as a defense against GAN-based Deepfake attacks. Different from the naive adversarial faces, our proposed approach leverages differentiable random image transformations during the generation. We also propose to use an ensemble-based approach to enhance the defense robustness against GAN-based Deepfake variants under the black-box setting. We show that training a Deepfake model with adversarial faces can lead to a significant degradation in the quality of synthesized faces. This degradation is twofold. On the one hand, the quality of the synthesized faces is reduced with more visual artifacts such that the synthesized faces are more obviously fake or less convincing to human observers. On the other hand, the synthesized faces can easily be detected based on various metrics.

研究の動機と目的

  • GANベースの Deepfake モデルが高精細な偽物コンテンツを生成する前に、事前にその品質を劣化させる攻撃的防御メカニズムを開発すること。
  • 被動的検出手法の限界を克服し、高品質な偽顔がそもそも生成されないようにすること。
  • アンサンブルベースのアプローチを用いて、黒箱設定下での GANベースの Deepfake 変種に対する耐性を強化すること。
  • 合成顔の品質劣化に寄与する主要な損失成分(敵対的損失およびエッジ損失)を同定すること。

提案手法

  • 事前学習済みの Deepfake モデルのディスクリミネーターを用いて adversarially に摂動を加えた顔を生成し、訓練中に微分可能でランダムな画像変換を組み込むことで耐性を向上させる。
  • 複数の摂動ステップ(例:PGD-01、PGD-005)を用いた PGD ベースの adversarial 訓練を実施し、変換制約下での摂動最適化を図る。
  • 複数の adversarial 顔生成手法を統合するアンサンブルベースの防御戦略を採用し、黒箱設定下での一般化性能を向上させる。
  • 訓練プロセス中に微分可能な操作としてランダムな画像変換(例:回転、スケーリング、クロッピング)を統合し、現実世界のデータ拡張を模擬する。
  • ManTra-Net などの汎用偽造検出器から得られる指標(AIH:平均クラス内同調性、ATI:平均上位強度)を用いて、合成顔の検出可能性を評価する。
  • adversarially 摂動を加えた顔を用いて Deepfake モデルを訓練し、複数の解像度および顔ペアの組み合わせにおいて、視覚的アーティファクトと検出可能性の両面で生成された顔の品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1変換感知型 adversarial 顔は、さまざまな攻撃設定下で GANベースの Deepfake 生成顔の品質を効果的に劣化させることができるか?
  • RQ2微分可能でランダムな画像変換を組み込むことで、黒箱設定下における adversarial 顔防御の耐性はどのように向上するか?
  • RQ3観察された合成顔品質の劣化に寄与する主な損失成分は何か?
  • RQ4提案された防御手法は、ManTra-Net などの汎用偽造検出モデルを用いて、どの程度検出可能性を向上させられるか?
  • RQ5アンサンブルベースのアプローチは、個別の adversarial 訓練戦略と比較して防御性能を向上させるか?

主な発見

  • PGD-01 法は白箱設定下で 8 つのテストケースのうち 5 つで最高の AIH スコアを達成し、合成顔品質の劣化に優れた性能を示した。
  • 白箱設定下では、PGD-01 が元のモデルと比較して平均で ATI スコアを 28% 向上させ、ManTra-Net による検出可能性が顕著に向上したことを示した。
  • 黒箱設定下ではアンサンブルベースの手法(Lite-Ens)が 8 ケース中 5 ケースで最高の AIH を記録し、未知の攻撃モデルに対しても耐性があることを確認した。
  • adversarial 損失およびエッジ損失が、合成顔品質の劣化に主に寄与することが同定され、これらの値が高くなるほど目立つアーティファクトが生じた。
  • この防御手法は、解像度および顔ペアの組み合わせに関係なく、合成顔の現実性を一貫して低下させ、複数の指標を通じて視覚的に検出可能で、識別が容易になるようにした。
  • 黒箱設定下でも、Lite-Ens のバージョンは単一手法のベースラインを上回り、アンサンブル戦略が一般化性能と耐性を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。