Skip to main content
QUICK REVIEW

[논문 리뷰] CAAD 2018: Generating Transferable Adversarial Examples

Yash Sharma, Tiendung Le|arXiv (Cornell University)|2018. 09. 29.
Adversarial Robustness in Machine Learning참고 문헌 27인용 수 4
한 줄 요약

이 논문은 CAAD 2018 경쟁 대회에서 공간 기울기 스무딩과 무작위 전처리를 활용하여 알려지지 않은 모델 간에 높은 이식성(transferability)을 가지는 전이 가능한 적대적 예제를 생성하는 최첨단 방법을 제시한다. 저자들은 비대상 및 대상 공격 트랙에서 모두 1등을 차지하였으며, 무작위화와 스무딩을 통한 기울기 기반 최적화가 계산 제약 조건을 충족하면서도 이식성을 크게 향상시킴을 입증하였다.

ABSTRACT

Deep neural networks (DNNs) are vulnerable to adversarial examples, perturbations carefully crafted to fool the targeted DNN, in both the non-targeted and targeted case. In the non-targeted case, the attacker simply aims to induce misclassification. In the targeted case, the attacker aims to induce classification to a specified target class. In addition, it has been observed that strong adversarial examples can transfer to unknown models, yielding a serious security concern. The NIPS 2017 competition was organized to accelerate research in adversarial attacks and defenses, taking place in the realistic setting where submitted adversarial attacks attempt to transfer to submitted defenses. The CAAD 2018 competition took place with nearly identical rules to the NIPS 2017 one. Given the requirement that the NIPS 2017 submissions were to be open-sourced, participants in the CAAD 2018 competition were able to directly build upon previous solutions, and thus improve the state-of-the-art in this setting. Our team participated in the CAAD 2018 competition, and won 1st place in both attack subtracks, non-targeted and targeted adversarial attacks, and 3rd place in defense. We outline our solutions and development results in this article. We hope our results can inform researchers in both generating and defending against adversarial examples.

연구 동기 및 목표

  • 실제 블랙박스 환경에서 알려지지 않은 모델을 성공적으로 속이는 높은 이식성을 가진 적대적 예제를 개발하는 것.
  • 엄격한 계산 및 변형 제약 조건을 준수하면서도 이전의 적대적 공격 방법을 향상시켜 이식성을 높이는 것.
  • 높은 정상 정확도를 유지하면서 강력한 적대적 공격에 저항할 수 있는 견고한 방어 메커니즘을 설계하는 것.
  • 기울기 스무딩과 무작위화가 이식성과 견고성 향상에 미치는 영향을 조사하는 것.
  • 특정 모델별 취약점을 악용하는 강력한, 이전에 보지 못한 공격에 잘 대응하는 방어를 제출하는 것.

제안 방법

  • 비대상 공격는 실시간 제약 조건을 회피하기 위해 사전 최적화를 수행하는 훈련된 적대적 변환 네트워크(ATN)를 사용한다.
  • 대상 공격의 경우, 이식성을 향상시키기 위해 기울기 기반 최적화와 무작위 전처리를 조합한다. 그러나 초기에는 시간 제한 내에서 너무 느려서 문제였다.
  • 공간 기울기 스무딩은 계산 제약 조건을 충족하면서도 높은 이식성을 유지하는 효율적인 대안으로 도입된다.
  • 최종 솔루션은 시간 제한 내에서 이식성을 추가로 향상시키기 위해 기울기 스무딩과 반복적 무작위화를 조합한다.
  • 방어는 '2 MSB' 기법을 활용하여 입력 이미지의 두 개의 가장 중요도 높은 비트만 앙상블된 적대적으로 훈련된 모델에 전달함으로써 변형에 대한 민감도를 감소시킨다.
  • 추가로 견고성을 확보하기 위해 경미한 베르누이 노이즈를 추가하고, 상위 예측 클래스가 '조각 맞추기' 클래스일 경우 잘못 분류되는 것을 방지하는 클래스 패치 메커니즘을 도입한다.

실험 결과

연구 질문

  • RQ1엄격한 시간 제약 조건 하에서 기울기 스무딩을 사용하여 이식 가능한 적대적 예제를 효율적으로 생성할 수 있는가?
  • RQ2무작위화를 기울기 기반 최적화와 조합할 경우 대상 공격에서 이식성에 어떤 영향을 미치는가?
  • RQ3비트 수준의 입력 조작과 노이즈 주입 기반 방어가 강력하고 적응적인 공격에 대해 얼마나 견고한가?
  • RQ4기울기 스무딩은 전적으로 이를 위해 설계되지 않았음에도 불구하고 왜 이렇게 강력한 이식성을 보이는가?
  • RQ5공격의 행동 양상을 알고 있음을 바탕으로 특정 공격(예: ATN)에 대해 방어를 강화시킬 수 있는가?

주요 결과

  • 기울기 스무딩과 무작위화의 조합은 비대상 및 대상 공격 하위 트랙에서 모두 1등을 차지하여 뛰어난 이식성을 입증하였다.
  • '2 MSB' 방어는 노이즈와 클래스 패치를 강화한 결과, ATN 공격에 대해 89.3%의 정상 정확도와 42.0%의 견고성을 확보하였다.
  • '노이즈 + 회피' 방어 변종은 ATN 공격에 대한 견고성을 2.0%에서 42.0%로 향상시켜, 모델 특화 지식이 방어 성능 향상에 상당한 기여를 한다는 것을 보여주었다.
  • 기울기 스무딩만으로도 순수한 무작위화보다 더 높은 이식성을 달성하였으며, 화이트박스 및 전이 설정 모두에서 '기울기 + 무작위화'가 '무작위화'보다 유의미하게 뛰어났다.
  • '드롭아웃' 방어는 더 공격적이며 정상 데이터에서 정확도가 낮지만, ATN 공격에 대해 '2 MSB'를 능가하여 청소년 정확도와 견고성 간의 상충 관계를 드러내었다.
  • 최종적으로 '2 MSB'에 노이즈와 회피 기법을 추가한 방어 솔루션은 정상 정확도와 견고성의 균형을 잘 유지하여, 팀의 자체 공격에 대해서도 특히 유리하여 제출 대상으로 선정되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.