Skip to main content
QUICK REVIEW

[논문 리뷰] OGAN: Disrupting Deepfakes with an Adversarial Attack that Survives Training

Eran Segalis, Eran Galili|arXiv (Cornell University)|2020. 06. 17.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 이중 최적화 프레임워크를 통해 공간-시간 왜곡을 주입함으로써 페이스 스왑 딥페이크를 방해하는 훈련에 저항하는 적대적 공격인 OGAN을 소개한다. 이 방법은 공격 샘플이 타겟 모델의 훈련 데이터에 포함되어 있더라도 지속되는 적대적 편향을 생성하며, 이는 이전의 Distorting Attack보다 이러한 상황에서 더 뛰어난 성능을 보인다.

ABSTRACT

Recent advances in autoencoders and generative models have given rise to effective video forgery methods, used for generating so-called "deepfakes". Mitigation research is mostly focused on post-factum deepfake detection and not on prevention. We complement these efforts by introducing a novel class of adversarial attacks---training-resistant attacks---which can disrupt face-swapping autoencoders whether or not its adversarial images have been included in the training set of said autoencoders. We propose the Oscillating GAN (OGAN) attack, a novel attack optimized to be training-resistant, which introduces spatial-temporal distortions to the output of face-swapping autoencoders. To implement OGAN, we construct a bilevel optimization problem, where we train a generator and a face-swapping model instance against each other. Specifically, we pair each input image with a target distortion, and feed them into a generator that produces an adversarial image. This image will exhibit the distortion when a face-swapping autoencoder is applied to it. We solve the optimization problem by training the generator and the face-swapping model simultaneously using an iterative process of alternating optimization. Next, we analyze the previously published Distorting Attack and show it is training-resistant, though it is outperformed by our suggested OGAN. Finally, we validate both attacks using a popular implementation of FaceSwap, and show that they transfer across different target models and target faces, including faces the adversarial attacks were not trained on. More broadly, these results demonstrate the existence of training-resistant adversarial attacks, potentially applicable to a wide range of domains.

연구 동기 및 목표

  • 기존의 딥페이크에 대한 적대적 공격가 훈련 데이터에 적대적 샘플이 포함될 경우 실패하는 한계를 해결하기 위해.
  • 적대적 예제가 모델의 훈련 세트에 포함되어 있든 말든 간에 효과적인 새로운 종류의 적대적 공격—훈련에 저항하는 공격—을 개발하기 위해.
  • 적대적 데이터 재훈련에 대한 강건성을 특별히 최적화한 새로운 공격 방법 OGAN을 설계하고 평가하기 위해.
  • 다양한 페이스 스왑 모델과 공격 훈련 기간 동안 볼 수 없었던 타겟 얼굴에 대해 OGAN과 이전의 Distorting Attack의 효과성을 검증하기 위해.
  • 장기적인 훈련 동안 딥페이크 출력에서 왜곡의 이동성과 지속성을 입증하기 위해.

제안 방법

  • 생성자와 페이스 스왑 오토인코더가 서로 적대적으로 훈련되는 양자 최적화 문제로 공격를 수립한다.
  • 페이스 스왑 모델이 처리할 때 눈에 띄는 공간-시간 왜곡을 유도하는 적대적 이미지를 생성하도록 생성자를 훈련시킨다.
  • 실제 적대적 동역학을 시뮬레이션하기 위해 생성자와 타겟 페이스 스왑 모델을 번갈아가며 최적화한다.
  • 페이스 스왑 모델의 출력에서 교란 왜곡을 유도하는 데 우선순위를 두는 손실 함수를 생성자에 도입한다.
  • 공격를 FaceSwap과 같은 인기 있는 페이스 스왑 구현체에 종단 간(end-to-end)으로 적용하여 이동성과 강건성을 평가한다.
  • 딥페이크 출력에서 공간-시간 왜곡 점수($S_{tmp}$)와 인지적 오차($E_{tmp}$)를 측정하여 성공 여부를 평가한다.

실험 결과

연구 질문

  • RQ1타겟 딥페이크 모델이 공격에 사용된 적대적 샘플을 기반으로 재훈련할 경우, 적대적 공격가 여전히 효과를 유지할 수 있는가?
  • RQ2적대적 샘플이 훈련 데이터에 포함되어 있을 때, OGAN 공격는 이전의 Distorting Attack보다 얼마나 더 강건한가?
  • RQ3이러한 공격는 공격 훈련 기간 동안 볼 수 없었던 다른 페이스 스왑 모델과 타겟 신원에 대해 어느 정도 이동성이 있는가?
  • RQ4타겟 모델의 장기적인 훈련은 적대적 공격가 유도한 왜곡의 지속성에 어떤 영향을 미치는가?
  • RQ5훈련에 저항하는 적대적 공격는 페이스 스왑 오토인코더 외의 다른 생성 모델로 일반화될 수 있는가?

주요 결과

  • OGAN은 적대적 데이터 기반으로 500,000 번의 훈련 반복 후에도 높은 공간-시간 왜곡 점수($S_{tmp} = 0.054$)를 유지하여 강력한 훈련 저항성을 입증한다.
  • Distorting Attack 또한 훈련 저항성을 보이며, 적대적 데이터 기반 500,000 번의 반복 후 $S_{tmp} = 0.021$을 기록하지만, OGAN에 비해 열등하다.
  • 적대적 샘플이 훈련에서 제외된 경우에도 OGAN은 여전히 뚜렷한 $S_{tmp}$ 점수를 기록하여, 훈련 전용 최적화 없이도 잔여 효과가 있음을 시사한다.
  • OGAN과 Distorting Attack 모두 공격 훈련 기간 동안 볼 수 없었던 타겟 얼굴과 다양한 페이스 스왑 모델(dfl-h128, dfl-sae, realface)로 성공적으로 이동된다.
  • 공격로 인한 왜곡의 $S_{tmp}$ 점수는 약 300,000 번의 훈련 반복 후 안정화되며, 장기적인 훈련 동안에도 지속적인 교란이 유지됨을 나타낸다.
  • 시각적 분석 결과, 왜곡이 딥페이크 영상에서 눈에 띄는 진동 현상으로 나타나 인간의 눈으로도 조작을 감지할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.