Skip to main content
QUICK REVIEW

[논문 리뷰] Universal, transferable and targeted adversarial attacks

Junde Wu, Rao Fu|arXiv (Cornell University)|2019. 08. 29.
Adversarial Robustness in Machine Learning참고 문헌 13인용 수 8
한 줄 요약

이 논문은 자연 이미지에서 특정 타겟 클래스로 오분류되는 전이 가능하고 표적 지정된 적대적 예제를 생성하는 유니버설 매핑을 학습하여, 처음으로 유니버설하고 전이 가능하며 표적 지정된 적대적 공격을 제안한다. 고주파수 성분이 적은, 전이성이 뛰어난 적대적 이미지의 특징 표현을 유사하게 유지함으로써, 이 방법은 최소한의 변형으로 다양한 모델, 특히 블랙박스 서버에서도 높은 성공률을 달성한다.

ABSTRACT

Deep Neural Networks have been found vulnerable re-cently. A kind of well-designed inputs, which called adver-sarial examples, can lead the networks to make incorrectpredictions. Depending on the different scenarios, goalsand capabilities, the difficulties of the attacks are different.For example, a targeted attack is more difficult than a non-targeted attack, a universal attack is more difficult than anon-universal attack, a transferable attack is more difficultthan a nontransferable one. The question is: Is there existan attack that can meet all these requirements? In this pa-per, we answer this question by producing a kind of attacksunder these conditions. We learn a universal mapping tomap the sources to the adversarial examples. These exam-ples can fool classification networks to classify all of theminto one targeted class, and also have strong transferability.Our code is released at: xxxxx.

연구 동기 및 목표

  • 가장 엄격한 위협 모델 조건(화이트박스, 유니버설, 표적 지정, 전이 가능)에서 유니버설하고 전이 가능하며 표적 지정된 적대적 공격가 동시에 존재할 수 있는지에 대한 열린 질문을 해결하기 위해.
  • 피해자 모델의 아키텍처나 기울기 정보 없이도 다양한 모델, 특히 블랙박스 시스템에서도 효과적인 적대적 예제를 생성할 수 있는 방법을 개발하기 위해.
  • 모델에 특화된 경계 곡률에 덜 민감한 저주파수 적대적 이미지를 활용하여 전이성을 향상시키기 위해.
  • 모든 입력 이미지에 대해 적대적 변형을 일반화할 수 있는 유니버설 매핑 네트워크(FTN)를 설계하여, 표적 지정 오분류를 유지하기 위해.

제안 방법

  • 저주파수 적대적 이미지(LFI)를 강력하고 전이 가능한 적대적 패tern의 대체 수단으로 도입하여, 시각적 구조 없이도 높은 신뢰도로 타겟 클래스로 분류되도록 최적화하여 생성한다.
  • VGG19의 ReLU 5-2, 5-3, 5-4 레이어에서 추출한 특징 수준 제약 조건을 활용하여, 생성된 적대적 예제의 고수준 표현을 LFI의 표현과 일치시켜 전이성을 보장한다.
  • 청정 이미지에서 적대적 예제로의 유니버설 매핑을 학습하는 신경망(FTN)을 훈련시키며, 표적 지정 오분류와 LFI 표현 유사도를 강제하는 손실 함수를 적용한다.
  • 고주파수 노이즈 정규화를 통한 기울기 기반 최적화를 적용하여, 적대적 변형이 작고 눈에 띄지 않게 하면서도 강건성을 유지한다.
  • 특징의 다양체 구조를 활용하여, 저주파수 패턴이 모델 간 경계 곡률의 차이에 더 강건하다고 주장함으로써 전이성을 향상시킨다.
  • 실제 웹 API 포함 화이트박스 및 블랙박스 모델에서 시험하여, 실제 제약 조건 하에서의 전이성과 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1가장 엄격한 위협 모델(화이트박스, 유니버설, 표적 지정, 전이 가능) 조건에서 유니버설하고 전이 가능하며 표적 지정된 적대적 공격를 동시에 달성할 수 있는가?
  • RQ2왜 저주파수 적대적 이미지가 고주파수 이미지보다 더 강한 전이성을 보이는가?
  • RQ3저주파수 적대적 이미지의 고수준 표현과 일치하도록 고수준 특징 표현을 제약 조건화하면, 유니버설 적대적 공격의 전이성이 향상되는가?
  • RQ4모델에 대한 액세스가 없는 상황에서, 제안된 방법이 블랙박스 모델에서 어떻게 성능을 발휘하는가?
  • RQ5특징 다원체 구조와 경계 곡률은 적대적 전이성의 결정 요소로 어떤 역할을 하는가?

주요 결과

  • 제안된 방법은 화이트박스 및 블랙박스 모델 모두를 고도로 오분류하는 유니버설하고 표적 지정된, 전이 가능한 적대적 예제를 성공적으로 생성한다.
  • 저주파수 적대적 이미지의 고수준 표현과 일치하도록 제약 조건을 걸린 적대적 예제는 기존 기울기 기반 방법보다 훨씬 높은 전이성을 보인다.
  • 모델 간 다양성에도 불구하고, ResNet, DenseNet, Inception 등 다양한 모델에서 높은 공격 성공률를 달성하며, 모델에 대한 액세스 없이도 블랙박스 API를 공격하는 데에도 효과적이다.
  • 실험 결과, 저주파수 적대적 이미지의 고수준 표현이 다양한 모델 간 유사한 경향을 보이며, 이는 자연 이미지 다원체에 가까운 특성 때문임을 확인했다.
  • 특징 공간 제약 조건은 공격를 모델에 특화된 경계 곡률에서 분리시키며, 이는 경계를 따라가는 방법보다 전이성이 향상되는 이유를 설명한다.
  • 제거 실험 결과, LFI 표현 제약 조건을 제거하면 전이성이 극적으로 감소함을 확인하여, 이 제약 조건이 방법의 성공에 핵심적인 역할을 한다는 것을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.