Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering Adversarial Examples with Momentum

Yinpeng Dong, Fangzhou Liao|arXiv (Cornell University)|2017. 10. 17.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 63
한 줄 요약

이 논문은 기울기 업데이트를 안정화하고 국소 최대값을 회피하기 위해 운동량 기반 반복적 적대적 공격 방법을 제안한다. 이는 블랙박스 공격에서 전이성과 성공률을 크게 향상시킨다. 이 방법은 최신 기술 수준의 성능을 달성하여 NIPS 2017에서 비대상 및 대상 적대적 공격 경쟁에서 모두 1등을 차지했다.

ABSTRACT

Deep neural networks are vulnerable to adversarial examples, which poses security concerns on these algorithms due to the potentially severe consequences. Adversarial attacks serve as an important surrogate to evaluate the robustness of deep learning models before they are deployed. However, most of existing adversarial attacks can only fool a black-box model with a low success rate. To address this issue, we propose a broad class of momentum-based iterative algorithms to boost adversarial attacks. By integrating the momentum term into the iterative process for attacks, our methods can stabilize update directions and escape from poor local maxima during the iterations, resulting in more transferable adversarial examples. To further improve the success rates for black-box attacks, we apply momentum iterative algorithms to an ensemble of models, and show that the adversarially trained models with a strong defense ability are also vulnerable to our black-box attacks. We hope that the proposed methods will serve as a benchmark for evaluating the robustness of various deep models and defense methods. With this method, we won the first places in NIPS 2017 Non-targeted Adversarial Attack and Targeted Adversarial Attack competitions.

연구 동기 및 목표

  • 기존의 블랙박스 모델에 대한 적대적 공격의 낮은 성공률 문제를 해결하기 위해.
  • 다양한 모델 간의 적대적 예제의 전이성 향상을 위해.
  • 딥러닝 모델의 강건성 평가를 위한 견고한 벤치마크를 개발하기 위해.
  • 심지어 적대적 훈련을 거친 모델도 제안된 공격에 여전히 취약함을 입증하기 위해.

제안 방법

  • 기울기 업데이트의 안정성과 부드러움을 향상시키기 위해 반복적 적대적 공격 과정에 운동량 항을 통합한다.
  • 과거 기울기의 누적 평균을 운동량으로 사용하여 방향을 안내하고 국소 최대값을 피한다.
  • 다양한 모델의 앙상블에 운동량 기반 공격를 적용하여 블랙박스 환경에서의 전이성을 향상시킨다.
  • 반복 최적화에 운동량을 적용하여 다양한 아키텍처에 일반화되는 적대적 예제를 생성한다.
  • 공격 과정 중 수렴성과 강건성을 향상시키기 위해 운동량 항을 활용한다.
  • 운동량 방법과 앙상블 기반 공격를 결합하여 알려지지 않은 모델 간의 전이 성공률를 극대화한다.

실험 결과

연구 질문

  • RQ1운동량은 블랙박스 환경에서 적대적 공격의 성공률를 향상시킬 수 있는가?
  • RQ2운동량 기반 반복적 방법은 적대적 예제의 전이성을 향상시키는가?
  • RQ3적대적 훈련을 거친 모델은 여전히 운동량 기반 공격에 취약한가?
  • RQ4앙상블 기반 운동량 공격는 단일 모델 공격보다 전이성에서 뛰어나게 성능을 발휘하는가?
  • RQ5기존의 반복적 공격 방법과 비교할 때 운동량 방법은 강건성과 전이성 측면에서 어떻게 다른가?

주요 결과

  • 운동량 기반 공격 방법은 비운동량 기반 기준 대비 블랙박스 적대적 공격의 성공률를 크게 향상시킨다.
  • 이 방법은 최신 기술 수준의 성능을 달성하여 NIPS 2017에서 비대상 및 대상 적대적 공격 경쟁에서 모두 1등을 차지했다.
  • 운동량 방법으로 생성된 적대적 예제는 다양한 모델 간에 높은 전이성을 보였다.
  • 강력한 적대적 방어 메커니즘을 갖춘 모델조차도 제안된 운동량 기반 공격에 여전히 취약하다.
  • 운동량 통합으로 공격 경로가 안정화되고 진동이 감소하여 보다 신뢰성 있고 일관된 변형이 가능해졌다.
  • 앙상블 기반 운동량 공격는 전이 성공률를 더욱 향상시켜 실제 블랙박스 시나리오에서 이 방법의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.