Skip to main content
QUICK REVIEW

[논문 리뷰] Protecting Against Image Translation Deepfakes by Leaking Universal Perturbations from Black-Box Neural Networks

Nataniel Ruiz, Sarah Adel Bargal|arXiv (Cornell University)|2020. 06. 11.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 8
한 줄 요약

이 논문은 GANimation 및 StarGAN과 같은 이미지 번역 딥패이크 시스템을 공격하는 데 있어 쿼리 효율성을 저하시키는 새로운 블랙박스 공격 방법인 유출되는 보편적 편향(LUP)을 소개한다. 두 단계의 접근 방식—초기 유출 단계에서 적대적 편향으로부터 이전 가능한 주성분(PCA) 성분을 추출하고, 이후 이용 단계에서 이러한 성분을 활용하는 방식—을 통해 LUP는 기존 최고 수준의 방법 대비 평균 쿼리 수를 30% 감소시킨다.

ABSTRACT

In this work, we develop efficient disruptions of black-box image translation deepfake generation systems. We are the first to demonstrate black-box deepfake generation disruption by presenting image translation formulations of attacks initially proposed for classification models. Nevertheless, a naive adaptation of classification black-box attacks results in a prohibitive number of queries for image translation systems in the real-world. We present a frustratingly simple yet highly effective algorithm Leaking Universal Perturbations (LUP), that significantly reduces the number of queries needed to attack an image. LUP consists of two phases: (1) a short leaking phase where we attack the network using traditional black-box attacks and gather information on successful attacks on a small dataset and (2) and an exploitation phase where we leverage said information to subsequently attack the network with improved efficiency. Our attack reduces the total number of queries necessary to attack GANimation and StarGAN by 30%.

연구 동기 및 목표

  • 모델 가중치와 기울기가 알려지지 않은 실제 블랙박스 환경에서 이미지 번역 딥패이크 시스템의 적대적 공격에 대한 취약성을 해결하기 위해.
  • 기존 블랙박스 공격가 요구하는 금방이 높은 쿼리 수를 감소시키기 위해.
  • 화이트박스 접근이 필요 없이도 실용적인 무력화를 가능하게 하는 확장성 있고 효율적인 방법을 개발하기 위해.
  • 초기 공격에서 유도된 이전 가능한 편향을 활용하여 후속 공격의 효율성을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • LUP 프레임워크는 두 단계로 구성된다: 작은 데이터셋에 전통적인 블랙박스 공격(예: SimBA)을 적용하여 적대적 편향을 생성하는 짧은 유출 단계.
  • 유출 단계 동안 수집된 편향에 주성분 분석(PCA)을 적용하여 주요이고 이전 가능한 공격 방향을 추출한다.
  • 이용 단계에서는 이러한 PCA 성분을 수정된 SimBA 알고리즘의 후보 공격 벡터로 사용하여 새로운 이미지를 더 효율적으로 공격한다.
  • 공격 손실이 포화 상태에 도달하고 성공이 이루어지지 않으면, 알고리즘은 기본 이미지 기저로 되돌아가 공격를 완료한다.
  • 이 방법은 서로 다른 이미지 간의 적대적 편향 간 상관관계를 활용하여 수렴 속도를 높인다.
  • 이 방법은 CelebA 데이터셋에서 GANimation 및 StarGAN과 같은 이미지 번역 모델에 적용된다.

실험 결과

연구 질문

  • RQ1딥패이크 생성에 사용되는 이미지 번역 모델에 대해 블랙박스 적대적 공격가 효과적으로 적용될 수 있는가?
  • RQ2초기 적대적 공격에서 유도된 정보를 활용하여 후속 공격에 필요한 쿼리 수를 줄일 수 있는가?
  • RQ3PCA로 학습된 편향의 이전 가능성은 이미지 번역 시스템에서 공격 효율성을 향상시키는가?
  • RQ4LUP 방법은 SimBA 및 Bandits-TD와 같은 최고 수준의 블랙박스 공격 방법과 비교해 쿼리 효율성과 성공률 측면에서 어떻게 다른가?

주요 결과

  • LUP는 GANimation 및 StarGAN에서 IT-SimBA 대비 공격에 성공하기 위해 필요한 평균 쿼리 수를 약 30% 감소시킨다.
  • GANimation에서 10만 장의 이미지를 공격하기 위해 LUP가 필요한 총 쿼리 수는 약 3940만 건이며, IT-SimBA는 5510만 건으로, 1570만 건의 쿼리가 감소되었다.
  • 이 방법은 테스트된 데이터셋에서 100%의 성공률를 기록했으며, 인간 관찰자에게는 인식하기 어려운 적대적 예제를 생성했다.
  • Bandits-TD는 이미지 분류에서는 효과적이지만, 이미지 번역 환경에서는 성능이 열 劣하므로 시간 단계 간 기울기 상관관계가 낮기 때문일 것이다.
  • 유출 단계는 이전 가능한 편향 패턴을 성공적으로 캡처했으며, 이는 이미지 번역 모델이 입력 간에 이용 가능한 상관관계를 지닌다는 것을 확인한다.
  • 쿼리 수가 낮을수록 누적 공격 성공률가 뚜렷하게 높은 것으로 나타났으며, 이는 쿼리 분포의 왼쪽으로 기울어진 히스토그램으로 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.