Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Robustness Toolbox v1.0.0

Maria-Irina Nicolae, Mathieu Sinn|arXiv (Cornell University)|2018. 07. 03.
Adversarial Robustness in Machine Learning인용 수 15
한 줄 요약

Adversarial Robustness Toolbox (ART) v1.0.0은 딥 뉴럴 네트워크, 트리 앙상블, 기존 머신러닝 모델 등을 포함한 다양한 머신러닝 모델에 대해 적대적 공격에 대비할 수 있도록 도와주는 종합적인 파이썬 라이브러리입니다. 이 라이브러리는 텐서플로우, 파이토치, 사이킷런 등 다양한 프레임워크를 지원하며, 표준화된 인터페이스를 제공하여 적대적 훈련, 입력 전처리, 런타임 탐지, CLEVER 및 클리크 기반 검증과 같은 정량적 평가 지표를 통한 강건성 평가를 가능하게 합니다.

ABSTRACT

Adversarial Robustness Toolbox (ART) is a Python library supporting developers and researchers in defending Machine Learning models (Deep Neural Networks, Gradient Boosted Decision Trees, Support Vector Machines, Random Forests, Logistic Regression, Gaussian Processes, Decision Trees, Scikit-learn Pipelines, etc.) against adversarial threats and helps making AI systems more secure and trustworthy. Machine Learning models are vulnerable to adversarial examples, which are inputs (images, texts, tabular data, etc.) deliberately modified to produce a desired response by the Machine Learning model. ART provides the tools to build and deploy defences and test them with adversarial attacks. Defending Machine Learning models involves certifying and verifying model robustness and model hardening with approaches such as pre-processing inputs, augmenting training data with adversarial samples, and leveraging runtime detection methods to flag any inputs that might have been modified by an adversary. The attacks implemented in ART allow creating adversarial attacks against Machine Learning models which is required to test defenses with state-of-the-art threat models. Supported Machine Learning Libraries include TensorFlow (v1 and v2), Keras, PyTorch, MXNet, Scikit-learn, XGBoost, LightGBM, CatBoost, and GPy. The source code of ART is released with MIT license at https://github.com/IBM/adversarial-robustness-toolbox. The release includes code examples, notebooks with tutorials and documentation (http://adversarial-robustness-toolbox.readthedocs.io).

연구 동기 및 목표

  • 다양한 모델 유형과 딥 러닝 프레임워크를 아우르는 적대적 위협에 대비한 통합적이고 오픈소스의 프레임워크를 제공함으로써 머신러닝 모델을 보호하는 것.
  • 표준화된 공격, 방어, 지표를 통해 적대적 강건성을 체계적으로 평가할 수 있도록 하는 것.
  • 모듈러하고 조합 가능한 방어 기법과 런타임 탐지 메커니즘을 제공하여 연구 및 생산 환경 모두에 적합한 지원을 제공하는 것.
  • 세미틱 버전 관리와 표준화된 인터페이스를 통해 일관되고 재현 가능한 결과를 확보하여 벤치마킹을 용이하게 하는 것.
  • CLEVER 및 트리 앙상블에 대한 클리크 기반 방법과 같은 강건성 검증 기법을 통합하여 모델 신뢰도를 향상시키는 것.

제안 방법

  • ART는 분류기, 공격, 방어, 탐지기, 지표에 대한 기본 클래스를 제공하는 모듈러 아키텍처를 구현하여 구성 요소 간의 플러그-앤플레이(Plug-and-Play) 통합을 가능하게 합니다.
  • 기울기 기반 및 최적화 기반 방법을 사용하여 FGSM, PGD, Carlini & Wagner, 경계 공격 등 다양한 적대적 공격을 지원하며, 적대적 예제를 생성합니다.
  • 방어 기법으로는 적대적 훈련, 피처 스러이싱, 레이블 스무딩, 공간 및 JPEG 전처리, 온도계 인코딩을 통한 랜덤라이즈드 스무딩 등이 포함됩니다.
  • 입력 및 활성화 통계 기반의 이진 탐지기(예: 빠른 일반화된 부분집합 스캔)를 사용하여 런타임에서의 회피 공격 탐지를 구현합니다.
  • 학습 중에 백도어 공격를 탐지하기 위해 활성화 클러스터링을 활용한 오염 방어 기법을 제공합니다.
  • 강건성 지표로는 모델 출력의 입력 변형에 대한 리프시츠 상수를 추정하는 CLEVER(리프시츠 기반 강건성 추정), 손실 민감도, 결정 트리 앙상블에 대한 클리크 기반 검증이 포함됩니다.

실험 결과

연구 질문

  • RQ1다양한 머신러닝 모델과 딥 러닝 프레임워크를 아우르는 적대적 공격 및 방어를 지원할 수 있는 통합적이고 확장 가능한 프레임워크를 어떻게 설계할 수 있는가?
  • RQ2적대적 공격에 대한 모델 강건성을 향상시키기 위해 가장 효과적이고 조합 가능한 방어 전략은 무엇인가?
  • RQ3모델 재학습이나 기울기 접근 없이도 강건성을 정량적으로 측정하고 검증할 수 있는 방법은 무엇인가?
  • RQ4런타임 탐지 메커니즘은 추론 성능에 영향을 주지 않으면서 실시간으로 적대적 입력을 얼마나 정확하게 식별할 수 있는가?
  • RQ5기울기 가능하지 않은 모델, 예를 들어 결정 트리 및 앙상블 모델에 대해 강건성 검증을 어떻게 적용할 수 있는가?

주요 결과

  • ART는 텐서플로우, 파이토치, 케라스, 사이킷런, 엑스그룹, 라이트그룹 등 다양한 프레임워크를 아우르는 적대적 방어의 일관된 벤치마킹을 가능하게 합니다.
  • CLEVER 지표는 모델 출력이 입력 변형에 대해 얼마나 리프시츠 연속적인지를 근사함으로써 적대적 강건성에 대한 신뢰할 수 있는 추정치를 제공합니다.
  • 데이터 증강과 입력 전처리(예: JPEG 압축, 공간 스무딩)를 포함한 적대적 훈련은 PGD 및 Carlini & Wagner 공격에 대한 모델 강건성을 크게 향상시킵니다.
  • 활성화 기반 이진 탐지기를 사용한 런타임 탐지 기법은 입력 수준의 전처리와 조합될 경우 특히 높은 정확도로 적대적 입력을 식별할 수 있습니다.
  • 결정 트리 앙상블에 대한 클리크 기반 방법은 앙상블 예측의 구조를 분석하고 최소한의 적대적 변형을 식별함으로써 공식적인 강건성 검증을 가능하게 합니다.
  • 라이브러리의 모듈러 설계 덕분에 적대적 훈련, 랜덤라이즈드 스무딩, 입력 전처리를 조합한 방어 파이프라인을 구성할 수 있어 종합적인 강건성 향상이 가능합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.