Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Adversarial Attack on Attention and the Resulting Dataset DAmageNet

Sizhe Chen, Zhengbao He|arXiv (Cornell University)|2020. 01. 16.
Adversarial Robustness in Machine Learning인용 수 13
한 줄 요약

이 논문은 표준 교차 엔트로피 손실 대신 주의 맵의 왜곡을 최적화함으로써 전이성(transferability)을 향상시키는 새로운 블랙박스 적대적 공격인 Attack on Attention (AoA)을 제안한다. ImageNet에서 50,000개의 유니버설 적대적 샘플을 생성함으로써 AoA는 13개의 잘 훈련된 모델에서 85% 이상의 top-1 오차율을 달성하며, 이는 적대적 훈련과 다수의 방어 기법에도 효과를 유지하는 첫 번째 유니버설 적대적 데이터셋인 DAmageNet을 구성한다.

ABSTRACT

Adversarial attacks on deep neural networks (DNNs) have been found for several years. However, the existing adversarial attacks have high success rates only when the information of the victim DNN is well-known or could be estimated by the structure similarity or massive queries. In this paper, we propose to Attack on Attention (AoA), a semantic property commonly shared by DNNs. AoA enjoys a significant increase in transferability when the traditional cross entropy loss is replaced with the attention loss. Since AoA alters the loss function only, it could be easily combined with other transferability-enhancement techniques and then achieve SOTA performance. We apply AoA to generate 50000 adversarial samples from ImageNet validation set to defeat many neural networks, and thus name the dataset as DAmageNet. 13 well-trained DNNs are tested on DAmageNet, and all of them have an error rate over 85%. Even with defenses or adversarial training, most models still maintain an error rate over 70% on DAmageNet. DAmageNet is the first universal adversarial dataset. It could be downloaded freely and serve as a benchmark for robustness testing and adversarial training.

연구 동기 및 목표

  • 기존 블랙박스 적대적 공격의 전이성 한계를 해결하기 위해 구조적 또는 기울기 유사성에 의존하는 방식을 목표로 한다.
  • DNN 간 공통의 의미적 취약점인 주의 맵 일관성(consistency)을 식별하고 악용한다.
  • 분류 손실이 아닌 주의 맵을 타깃으로 삼는 손실 함수를 개발하여 전이성을 향상시킨다.
  • 다양한 아키텍처를 가진 다양한 사전 훈련된 모델에 대해 일반화 가능한 대규모 유니버설 적대적 데이터셋(DAmageNet)을 구축한다.
  • 적대적 훈련이나 다수의 방어 기법이 적용된 환경에서도 주의 기반 공격가 기존 방법보다 전이성이 뛰어나다는 것을 입증한다.

제안 방법

  • 표준 교차 엔트로피 손실을 원래 주의 맵 분포에서의 이탈을 처벌하는 주의 기반 손실로 대체한다.
  • 원래 이미지의 시각적 흐린 정도를 유지하면서 주의 맵의 산산이 흩어지는 것을 유도하는 변형을 생성하기 위해 적대적 공격 네트워크를 훈련시킨다.
  • 훈련된 공격 모델을 사용하여 ImageNet 검증 세트에서 유니버설 적대적 예제를 생성한다.
  • ImageNet 검증 세트의 50,000개 이미지에 공격를 적용하여, 유니버설 적대적 샘플로 구성된 DAmageNet 데이터셋을 생성한다.
  • 기존의 전이성 향상 기법(예: SI)과 AoA를 조합하여 성능을 추가로 향상시킨다.
  • 다양한 모델, 특히 적대적 훈련 및 방어 메커니즘을 적용한 모델에 대해 생성된 적대적 샘플을 평가한다.

실험 결과

연구 질문

  • RQ1다양한 DNN에 걸쳐 주의 맵이 블랙박스 공격에서 일반적인 의미적 취약점으로 기능할 수 있는가?
  • RQ2교차 엔트로피 손실을 주의 손실로 대체하면 공격의 전이성이 현저히 향상되는가?
  • RQ3일관된 하나의 적대적 변형 집합이 다양한 아키텍처를 가진 사전 훈련된 모델 전반에 걸쳐 일반화 가능한가?
  • RQ4적대적 훈련이나 입력 전처리를 통해 강화된 모델에 대해 AoA 생성 샘플은 얼마나 효과적인가?
  • RQ5주의 기반 공격를 활용하여 대규모 유니버설 적대적 데이터셋을 구성할 수 있으며, 이는 강건성 평가의 기준이 될 수 있는가?

주요 결과

  • AoA는 전이성 향상 기법을 조합할 경우 기존 교차 엔트로피 기반 공격 대비 전이성을 10%에서 15% 향상시킨다.
  • AoA를 사용해 생성된 DAmageNet은 방어 기법이 적용되지 않은 13개의 잘 훈련된 DNN에서 top-1 오차율이 85% 이상을 기록한다.
  • DAmageNet에 대해 적대적 훈련을 거친 모델들 역시 70% 이상의 오차율을 유지하며, AoA에 대한 강건성 실패를 보여준다.
  • JPEG 압축, 픽셀화, 무작위화 등의 방어 기법은 DAmageNet에서 오차율 감소가 미미하여 효과가 제한적임을 시사한다.
  • 특징 노이즈 제거 모델은 강건성이 향상되지만, 전처리 기반 방어 기법은 AoA 공격를 효과적으로 억제하지 못한다.
  • DAmageNet은 첫 번째 유니버설 적대적 데이터셋이며, 모델 강건성 평가 및 적대적 훈련을 위한 벤치마크로 자유롭게 이용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.