Skip to main content
QUICK REVIEW

[논문 리뷰] Structure-Preserving Transformation: Generating Diverse and Transferable Adversarial Examples

Dan Peng, Zizhan Zheng|arXiv (Cornell University)|2018. 09. 08.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 4
한 줄 요약

이 논문은 이미지의 구조적 패턴을 유지하면서 색상과 밝기에서 눈에 띄는 변화를 허용함으로써 자연스럽고 다양하며 높은 이동성(transferability)을 가진 적대적 예제를 생성하는 구조 보존 변환(SPT)을 제안한다. 전통적인 방법이 ℓp 노름의 크기가 작은 변형에 국한되는 것과 달리, SPT는 인간의 인지적 유사성을 보장하기 위해 의미론적 구조를 유지함으로써, 방어 모델이나 다양한 아키텍처 간에도 높은 공격 성공률를 달성한다.

ABSTRACT

Adversarial examples are perturbed inputs designed to fool machine learning models. Most recent works on adversarial examples for image classification focus on directly modifying pixels with minor perturbations. A common requirement in all these works is that the malicious perturbations should be small enough (measured by an L_p norm for some p) so that they are imperceptible to humans. However, small perturbations can be unnecessarily restrictive and limit the diversity of adversarial examples generated. Further, an L_p norm based distance metric ignores important structure patterns hidden in images that are important to human perception. Consequently, even the minor perturbation introduced in recent works often makes the adversarial examples less natural to humans. More importantly, they often do not transfer well and are therefore less effective when attacking black-box models especially for those protected by a defense mechanism. In this paper, we propose a structure-preserving transformation (SPT) for generating natural and diverse adversarial examples with extremely high transferability. The key idea of our approach is to allow perceptible deviation in adversarial examples while keeping structure patterns that are central to a human classifier. Empirical results on the MNIST and the fashion-MNIST datasets show that adversarial examples generated by our approach can easily bypass strong adversarial training. Further, they transfer well to other target models with no loss or little loss of successful attack rate.

연구 동기 및 목표

  • 작은 변형에 의존하는 기존 적대적 공격의 한계를 해결하기 위해, 자연스럽지 않고 다양성이 낮으며 이동성이 떨어지는 예제를 생성하는 문제를 해결한다.
  • ℓp 노름에 의존하는 것에서 벗어나, 인간의 인지에 중요한 구조적 패턴을 간과하고 분포 이탈에 대한 저항력을 떨어뜨리는 문제를 해결한다.
  • 학습 데이터와 다른 데이터 분포를 따르는 적대적 예제를 생성함으로써 블랙박스 공격의 성공률를 향상시킨다.
  • 최소 변형이 아닌 구조적 불변성(structural invariance)을 활용함으로써 적대적 훈련 방어를 효과적으로 우회할 수 있도록 한다.
  • 깊이 신경망의 일반화와 취약성에서 구조적 패턴의 역할을 탐구한다.

제안 방법

  • SPT는 가시적 구조 패턴을 고려하는 가속 가능한 변환을 적용하여, 균일한 변형이 아닌 국소적 구조 패턴에 기반해 픽셀 값을 수정한다.
  • 이 방법은 인간의 인식에 핵심적인 형태와 윤곽 특징을 유지하면서도 밝기와 색상을 변경한다.
  • 변환은 각 입력 이미지의 구조적 내용에 적응하는 학습 가능한 가중치로 매개변수화된다.
  • 이 접근법은 ℓp 노름 제약을 피함으로써, 의미론적 유사성을 유지하면서도 눈에 띄는 변화를 허용한다.
  • 적대적 예제는 오분류를 최적화하면서도, 미분 가능한 손실 함수를 통해 구조 보존을 강제함으로써 생성된다.
  • 이 방법은 MNIST와 패션-MNIST에서 평가되었으며, 표준 모델과 적대적 훈련된 모델을 모두 대상으로 공격한다.

실험 결과

연구 질문

  • RQ1작은 ℓp 변형에 의존하지 않고도, 시각적으로 자연스럽고 다양한 적대적 예제를 생성할 수 있는가?
  • RQ2이미지의 구조적 패턴을 유지함으로써 다양한 모델과 방어 기법 간의 이동성이 향상되는가?
  • RQ3색상과 밝기가 크게 다를 수 있는 적대적 예제조차도 DNN이 잘못 분류할 수 있는가?
  • RQ4기존의 ℓp 기반 공격가 왜 방어 모델로의 이동에 효과적으로 실패하는가?
  • RQ5DNN이 분포 외 이미지를 분류할 때, 픽셀 분포에 더 의존하는가, 아니면 구조적 패턴에 더 의존하는가?

주요 결과

  • SPT로 생성된 적대적 예제는 PGD 기반 방어를 포함한 표준 및 적대적 훈련된 모델에서 거의 100%의 공격 성공률를 달성한다.
  • 다양한 아키텍처 간에 효과적으로 이동되며, 특히 강력한 방어 메커니즘을 사용하는 타겟 모델에서도 성공률 손실가 최소화된다.
  • SPT로 생성된 적대적 예제는 구조를 유지하면서도 밝기와 색상이 다양한 타겟 모델 간에 다양성을 보이며, 높은 다양성을 나타낸다.
  • SPT의 성공은 학습 데이터와 다른 데이터 분포에서 예제를 생성할 수 있다는 점에 기인하며, 이는 현재 방어 기법의 i.i.d. 가정을 뒤흔든다.
  • DNN이 SPT 예제를 잘못 분류하는 주된 이유는 형태의 차이 때문이 아니라 픽셀 값의 분포 이탈 때문이며, 이는 통계적 패턴에 더 의존함을 시사한다.
  • 특히 회색조 이미지에서 기존의 GAN 기반 및 색상 공간 변환 방법보다 다양성과 이동성 면에서 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.