Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Transferable Adversarial Examples via Ghost Networks

Yingwei Li, Song Bai|arXiv (Cornell University)|2018. 12. 09.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 13
한 줄 요약

이 논문은 단일 기본 모델의 중간층에 특징 수준의 교란(네트워크 침식)을 적용하여 다수의 다양하고 가상의 모델을 생성하는 Ghost Networks를 제안한다. 이를 통해 매우 높은 전이성을 가진 적대적 예제를 생성할 수 있다. 종단형 앙상블을 통해 이러한 가상 모델들을 융합함으로써, 계산 비용을 최소화하면서도 블랙박스 공격 성능을 크게 향상시켰으며, NeurIPS 2017 적대적 공격 챌린지의 최고 기여물보다 평균적으로 6.02% 높은 성능을 기록했다.

ABSTRACT

Recent development of adversarial attacks has proven that ensemble-based methods outperform traditional, non-ensemble ones in black-box attack. However, as it is computationally prohibitive to acquire a family of diverse models, these methods achieve inferior performance constrained by the limited number of models to be ensembled. In this paper, we propose Ghost Networks to improve the transferability of adversarial examples. The critical principle of ghost networks is to apply feature-level perturbations to an existing model to potentially create a huge set of diverse models. After that, models are subsequently fused by longitudinal ensemble. Extensive experimental results suggest that the number of networks is essential for improving the transferability of adversarial examples, but it is less necessary to independently train different networks and ensemble them in an intensive aggregation way. Instead, our work can be used as a computationally cheap and easily applied plug-in to improve adversarial approaches both in single-model and multi-model attack, compatible with residual and non-residual networks. By reproducing the NeurIPS 2017 adversarial competition, our method outperforms the No.1 attack submission by a large margin, demonstrating its effectiveness and efficiency. Code is available at https://github.com/LiYingwei/ghost-network.

연구 동기 및 목표

  • 블랙박스 적대적 공격을 위해 다수의 다양하고 독립적인 모델을 훈련하고 앙상블하는 데 드는 높은 계산 비용을 해결하기 위해.
  • 다수의 독립적 훈련된 모델을 사용하지 않고도 적대적 예제의 전이성을 향상시키기 위해.
  • 단일 모델 및 다중 모델 공격을 모두 향상시킬 수 있는 경량이며 플러그인 호환 가능한 방법을 개발하기 위해.
  • 앙상블 내 부재 모델의 수가 독립적으로 훈련된 모델의 다양성보다 더 중요하다는 것을 입증하기 위해.

제안 방법

  • Ghost Networks는 단일 기본 모델의 중간층에 실시간으로 특징 수준의 교란(침식)을 적용하여 훈련하거나 저장하지 않은 가상의 모델로 생성된다.
  • 잔차 레이어나 다른 레이어(예: 배치 정규화, ReLU)에 네트워크 침식을 적용하여 다양한 모델 변종을 생성한다.
  • 종단형 앙상블은 공격 반복 과정에서 가상 네트워크의 기울기를 암묵적으로 융합하는 융합 전략으로, 명시적 모델 평균화의 복잡성을 피한다.
  • 이 방법은 다양한 공격 알고리즘(예: I-FGSM, MI-FGSM)과 네트워크 아키텍처(잔차형 및 비잔차형)와 호환된다.
  • 이 방법은 단일 기본 모델을 활용하여 큰 앙상블의 내재된 모델 수를 시뮬레이션함으로써 효율적인 적대적 예제 생성을 가능하게 한다.
  • 이 방법은 플러그 앤 플레이 방식으로, 화이트박스 및 블랙박스 공격 설정 모두에 적용 가능하며, 표준 모델과 적대적으로 훈련된 모델 모두와 작동한다.

실험 결과

연구 질문

  • RQ1단일 기본 모델이 적대적 전이성을 향상시키는 데 기여하는 다수의 다양하고 가상의 모델을 생성할 수 있는가?
  • RQ2앙상블 내 내재된 모델의 수가 독립적으로 훈련된 모델의 다양성보다 더 중요한가?
  • RQ3경량이며 암묵적인 앙상블 전략(종단형 앙상블)이 성능을 저하시키지 않고 명시적 모델 평균화를 대체할 수 있는가?
  • RQ4Ghost Networks는 계산 비용을 최소화하면서도 단일 모델 및 다중 모델 블랙박스 공격을 모두 향상시킬 수 있는가?

주요 결과

  • Ghost Networks는 NeurIPS 2017 최고 기여물의 평균 블랙박스 공격 성공률을 33.57%에서 39.59%로 향상시켜 6.02% 향상시켰다.
  • iyswim 방어 모델에서의 향상률은 9.08%였으며, 다양한 방어 메커니즘에 대한 강력한 일반화 능력을 보였다.
  • Exp. M5는 하나의 기본 모델만 사용했지만 내재된 30개의 가상 네트워크를 활용하여, 세 개의 독립적 훈련 모델을 사용한 Exp. M2보다 MI-FGSM 기준 6.70% 높은 성능을 기록했다.
  • 세 개의 적대적으로 훈련된 모델을 대상으로 테스트한 결과, Ghost Networks를 사용할 경우 공격 성공률이 MI-FGSM의 79.32%에서 87.14%로 향상되었다.
  • 이 방법은 NeurIPS 2017 적대적 공격 챌린지 벤치마크에서 최고 성능을 기록하여 공식 1위 기여물도 초월했다.
  • Ghost Networks는 계산적으로 효율적이며 다양한 아키텍처, 공격 방법, 방어 메커니즘과 호환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.