Skip to main content
QUICK REVIEW

[논문 리뷰] MULDEF: Multi-model-based Defense Against Adversarial Examples for Neural Networks

Siwakorn Srisakaokul, Yuhao Zhang|arXiv (Cornell University)|2018. 08. 31.
Adversarial Robustness in Machine Learning참고 문헌 36인용 수 16
한 줄 요약

MulDef는 다양한 다중 모델 시스템을 활용하여 신경망의 적대적 예측에 대한 강건성을 향상시키는 혁신적인 방어 프레임워크이다. 적대적 예제로 훈련된 여러 모델 중에서 무작위로 선택하여, 화이트박스 공격 상황에서 22–74% 높은 적대적 정확도를 달성하면서도 정상 입력에 대한 표준 정확도를 유지한다.

ABSTRACT

Despite being popularly used in many applications, neural network models have been found to be vulnerable to adversarial examples, i.e., carefully crafted examples aiming to mislead machine learning models. Adversarial examples can pose potential risks on safety and security critical applications. However, existing defense approaches are still vulnerable to attacks, especially in a white-box attack scenario. To address this issue, we propose a new defense approach, named MulDef, based on robustness diversity. Our approach consists of (1) a general defense framework based on multiple models and (2) a technique for generating these multiple models to achieve high defense capability. In particular, given a target model, our framework includes multiple models (constructed from the target model) to form a model family. The model family is designed to achieve robustness diversity (i.e., an adversarial example successfully attacking one model cannot succeed in attacking other models in the family). At runtime, a model is randomly selected from the family to be applied on each input example. Our general framework can inspire rich future research to construct a desirable model family achieving higher robustness diversity. Our evaluation results show that MulDef (with only up to 5 models in the family) can substantially improve the target model's accuracy on adversarial examples by 22-74% in a white-box attack scenario, while maintaining similar accuracy on legitimate examples.

연구 동기 및 목표

  • 특히 화이트박스 공격 조건에서 지속적인 취약성을 보이는 신경망의 문제를 해결한다.
  • 재공격, 전이성, 탈락 가능한 딜리게이션 등의 기존 방어 기법의 한계를 극복하기 위해 강건성 다양성을 도입한다.
  • 기존 타겟 모델의 아키텍처나 훈련 과정을 수정하지 않으며, 일반적이고 확장 가능한 방어 프레임워크를 개발한다.
  • 모델 가족 설계와 런타임 선택 전략을 통해 화이트박스 및_BLK박스 공격 상황 모두에서 뛰어난 성능을 확보한다.
  • 최대 5개의 모델로도 충분히 높은 방어 능력을 확보하면서 효율성과 실용성을 유지한다.

제안 방법

  • 이전에 훈련된 모델들로부터 생성한 적대적 예제를 사용하여 타겟 모델의 여러 변종을 생성함으로써 모델 가족을 구성한다.
  • 공격자가 사용될 모델를 예측할 수 없도록 추론 시기 무작위 모델 선택 전략을 적용한다.
  • 각 모델를 서로 다른 적대적 예제로 훈련시켜 강건성 다양성을 확보함으로써, 한 모델에 효과적인 공격이 다른 모델에선 실패하도록 한다.
  • 모델 가족 내 모든 모델에 동일한 아키텍처를 사용하지만, 적대적 예제 삽입을 통해 훈련 데이터 분포를 다양화한다.
  • 각 모델 내에서 적대적 훈련 및 딜리게이션과 같은 기존 방어 기법을 활용하여 개별 모델의 강건성을 향상시킨다.
  • 정상 예제에 대한 성능이 원본 모델과 유사하게 유지되도록 모델 가족이 정상 예측 성능을 손상시키지 않도록 한다.

실험 결과

연구 질문

  • RQ1단일 모델 방어 대비 다중 모델 방어 프레임워크가 화이트박스 적대적 공격에 대해 강건성을 향상시킬 수 있는가?
  • RQ2강건성 다양성이 적대적 기계학습에서 전이성과 재공격 취약성을 얼마나 효과적으로 완화하는가?
  • RQ3가족 내 모델 수가 적을 경우(예: 5개) 정상 정확도를 저하시키지 않고 적대적 정확도를 얼마나 높일 수 있는가?
  • RQ4딜리게이션을 우회당하더라도 추론 시기의 무작위 모델 선택 전략이 기울기 기반 공격을 효과적으로 방해하는가?
  • RQ5제안된 프레임워크는 아키텍처 수정 없이도 기존에 훈련된 모델에 일반적으로 적용 가능한가?

주요 결과

  • MulDef는 화이트박스 공격(FGSM, C&W, PGD) 상황에서 MNIST 및 CIFAR-10에서 22–74% 높은 적대적 정확도를 확보하며, 기준 방어 기법들을 크게 능가한다.
  • 정상(비적대적) 예제에 대해 거의 동일한 정확도를 유지하여 표준 성능에 대한 저하가 없음을 입증한다.
  • 블랙박스 공격 상황에서도 MulDef는 적대적 정확도를 2–10% 향상시켜 광범위한 스펙트럼의 강건성을 보여준다.
  • 가족 내 최대 5개의 모델로도 강력한 성능을 달성하여 확장성과 효율성을 입증한다.
  • 강건성 다양성이 효과적으로 전이성과 재공격를 방지함을 입증하였으며, 한 모델에 효과적인 적대적 예제가 가족 내 다른 모델에선 실패한다.
  • 이 방법은 기존 모델의 아키텍처나 훈련 과정을 수정하지 않아도 되므로 일반적이며, 기존 모델에 쉽게 통합할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.