Skip to main content
QUICK REVIEW

[논문 리뷰] Imperceptible Adversarial Examples for Fake Image Detection

Quanyu Liao, Yuezun Li|arXiv (Cornell University)|2021. 06. 03.
Adversarial Robustness in Machine Learning참고 문헌 19인용 수 4
한 줄 요약

이 논문은 다층 특징 맵을 통해 식별된 가장 중요한 픽셀에만 초점을 맞춰, 가짜 이미지 검출기들을 속이기 위한 눈에 띄지 않는 적대적 예제를 생성하는 새로운 방법인 키 리전 어택(Key Region Attack, KRA)을 제안한다. KRA는 편향의 $L_0$ 및 $L_2$ 노름을 최소화함으로써 기존 방법에 비해 눈에 띄는 정도가 크게 낮아졌음에도 불구하고 최신 기술 수준의 공격 성공률을 달성한다.

ABSTRACT

Fooling people with highly realistic fake images generated with Deepfake or GANs brings a great social disturbance to our society. Many methods have been proposed to detect fake images, but they are vulnerable to adversarial perturbations -- intentionally designed noises that can lead to the wrong prediction. Existing methods of attacking fake image detectors usually generate adversarial perturbations to perturb almost the entire image. This is redundant and increases the perceptibility of perturbations. In this paper, we propose a novel method to disrupt the fake image detection by determining key pixels to a fake image detector and attacking only the key pixels, which results in the $L_0$ and the $L_2$ norms of adversarial perturbations much less than those of existing works. Experiments on two public datasets with three fake image detectors indicate that our proposed method achieves state-of-the-art performance in both white-box and black-box attacks.

연구 동기 및 목표

  • 전체 이미지에 편향을 적용하는 기존의 적대적 공격 방법이 인지 가능성과 계산 비용을 증가시키는 한계를 해결하기 위해.
  • 눈에 띄는 정도를 향상시키기 위해 적대적 편향의 $L_0$ 및 $L_2$ 노름을 동시에 최소화하기 위해.
  • 가짜 검출기가 분류에 의존하는 가장 의미 있는 의미적 픽셀만 식별하고 공격하기 위해.
  • 다양한 공격 방법(예: FGSM, DeepFool)을 통합할 수 있는 융통성 있는 프레임워크를 개발하여 효율적이고 효과적인 탈출을 위해.
  • 낮은 인지 가능성과 함께 화이트박스 및_BLK박스 환경 모두에서 높은 공격 성공률를 달성하기 위해.

제안 방법

  • KRA는 다층 특성 맵을 통합하여 검출에 핵심적인 영역을 식별하는 다층 키 세미틱 리전 선택(Multi-Layers Key Semantic Region Selection, MLSKRS)을 사용하여 키 픽셀을 식별한다.
  • MLSKRS는 浅층 및 깊은 층의 공간적 정보와 기울기 정보를 활용하여 키 픽셀의 밀도가 높고 영향력 있는 마스크 $\mathcal{M}$을 생성한다.
  • 이 방법은 공격 문제를 $||r||_2 + ||\mathcal{M}||_0$의 최소화로 재구성하며, 여기서 $r$은 편향이고 $\mathcal{M}$은 키 픽셀의 집합이다. 이는 희박성과 낮은 왜곡을 보장한다.
  • KRA는 표준 적대적 공격 방법(예: PGD, DeepFool)을 통합하는 컨테이너로 설계되어, 선택된 키 픽셀에만 편향을 생성한다.
  • 프레임워크는 마스킹된 키 영역에서만 기울기 기반 최적화를 적용하여 수정되는 픽셀 수와 계산 비용을 크게 줄인다.
  • 최종 키 픽셀 마스크를 정밀하게 조정하기 위해 $t_\alpha = 0.8$, $t' = 0.1$, 및 $\beta = 0.1$의 파rameter를 사용하는 임계값 전략을 적용한다.

실험 결과

연구 질문

  • RQ1소수의 키 픽셀에만 공격하는 것이 인지 가능성은 최소화하면서도 가짜 이미지 검출을 크게 방해할 수 있는가?
  • RQ2다양한 컨볼루션 층의 특징 맵을 조합하면 최종 층만 사용하는 것보다 키 픽셀 식별의 정확도와 희박성가 향상되는가?
  • RQ3편향의 $L_0$ 및 $L_2$ 노름을 동시에 줄이는 것이 공격 성공률를 희생시키지 않으면서도 더 눈에 띄지 않는 적대적 예제를 만드는 데 기여하는가?
  • RQ4제안된 방법이 블랙박스 공격 시나리오에서 강력한 전이성을 가지는가?
  • RQ5다양한 공격 알고리즘(예: PGD, DeepFool)의 통합이 키 픽셀에 제한된 경우 성능에 어떤 영향을 미치는가?

주요 결과

  • KRA는 화이트박스 공격에서 최신 기술 수준의 공격 성공률를 달성하여, 세 가지 가짜 검출기(Xception, Inception-v3, ResNet)의 정확도를 0.01 이하로 낮춘다.
  • KRA가 생성한 편향의 $L_2$ 노름은 PGD 기반 공격에 비해 10배 감소했고, $L_2$ 최소화 기반 기준선에 비해 100배 감소했다.
  • KRA 편향의 $L_0$ 노름은 $L_0$ 기반 공격 방법에 비해 10배 낮아, 훨씬 더 희박한 편향임을 나타낸다.
  • 블랙박스 공격에서 KRA는 공격 전이 비율(Attack Transfer Ratio, ATR)이 50% ± 15% 범위 내에서 강력한 전이성을 유지하여 뛰어난 일반화 능력을 보였다.
  • 정성적 결과는 편향이 키 영역에만 국한되어 있으며, 심지어 [0,255] 범위로 정규화된 경우에도 인간 관찰자에게 눈에 띄지 않는다는 것을 보여준다.
  • 이 방법은 계산 비용과 인지 가능성 둘 다를 줄이기 위해 희미한 의미적 픽셀 부분집합에 편향을 제한함으로써 높은 효율성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.