Skip to main content
QUICK REVIEW

[논문 리뷰] How Wrong Am I? - Studying Adversarial Examples and their Impact on Uncertainty in Gaussian Process Machine Learning Models

Kathrin Grosse, David Pfaff|arXiv (Cornell University)|2017. 11. 17.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 6
한 줄 요약

이 논문은 베이지안 불확실성의 관점에서 가우시안 프로세스 모델에서의 적대적 예제를 조사하며, 최신 공격 기법에서 유도된 변형이 예측 불확실성에 유의미한 증가를 초래함을 보여준다. 최적화되지 않은 불확실성 임계값조차도 많은 적대적 예제를 거부할 수 있으나, 수정된 공격을 통해 강건성은 극복될 수 있다.

ABSTRACT

Machine learning models are vulnerable to Adversarial Examples: minor perturbations to input samples intended to deliberately cause misclassification. Current defenses against adversarial examples, especially for Deep Neural Networks (DNN), are primarily derived from empirical developments, and their security guarantees are often only justified retroactively. Many defenses therefore rely on hidden assumptions that are subsequently subverted by increasingly elaborate attacks. This is not surprising: deep learning notoriously lacks a comprehensive mathematical framework to provide meaningful guarantees. In this paper, we leverage Gaussian Processes to investigate adversarial examples in the framework of Bayesian inference. Across different models and datasets, we find deviating levels of uncertainty reflect the perturbation introduced to benign samples by state-of-the-art attacks, including novel white-box attacks on Gaussian Processes. Our experiments demonstrate that even unoptimized uncertainty thresholds already reject adversarial examples in many scenarios. Comment: Thresholds can be broken in a modified attack, which was done in arXiv:1812.02606 (The limitations of model uncertainty in adversarial settings).

연구 동기 및 목표

  • 가우시안 프로세스 모델에서의 적대적 변형이 예측 불확실성에 미치는 영향을 분석하는 것.
  • 불확실성 추정치가 적대적 예제에 대한 신뢰할 수 있는 방어 수단으로 기능할 수 있는지 평가하는 것.
  • 가우시안 프로세스 모델을 전용으로 공격하는 새로운 화이트박스 공격 기법을 개발하고 테스트하는 것.
  • 점차적으로 발전하는 공격에 대해 불확실성 기반 거부 임계값의 강건성을 평가하는 것.

제안 방법

  • 예측 불확실성을 모델링하기 위해 가우시안 프로세스를 베이지안 프레임워크로 활용하는 것.
  • 예측 분산을 사용하여 적대적 변형에 대한 불확실성 변화를 정량화하는 것.
  • 상태의 최신 화이트박스 적대적 공격을 적용하여 GP 모델의 변형 입력을 생성하는 것.
  • 높은 불확실성의 입력을 거부하기 위해 불확실성 임계값을 적용하고, 이러한 방법이 적대적 예제 탐지에 얼마나 효과적인지 평가하는 것.
  • 불확실성 기반 탐지 방식을 우회하는 데 성공한 수정된 공격 전략을 도입하여 이러한 방어 수단의 취약성을 입증하는 것.
  • 일반화성을 확보하기 위해 여러 데이터셋과 GP 모델 구성에서 성능을 평가하는 것.

실험 결과

연구 질문

  • RQ1적대적 변형이 가우시안 프로세스 모델에서 예측 불확실성에 얼마나 큰 영향을 미치는가?
  • RQ2최적화되지 않은 불확실성 임계값이 GP 모델에서 적대적 예제를 효과적으로 탐지하고 거부할 수 있는가?
  • RQ3새로운 GP 모델 전용 화이트박스 공격 기법은 불확실성 기반 탐지 방식을 얼마나 효과적으로 우회할 수 있는가?
  • RQ4수정된 공격 전략이 불확실성 기반 방어를 우회할 수 있으며, 만약 가능하면 그 방법은 무엇인가?
  • RQ5적대적 환경에서 불확실성만을 기반으로 한 방어 수단의 한계는 무엇인가?

주요 결과

  • 다양한 데이터셋과 아키텍처에서 적대적 변형이 가우시안 프로세스 모델의 예측 불확실성을 일관되게 증가시킨다.
  • 모델 재학습 없이도 최적화되지 않은 불확실성 임계값조차도 상당 부분의 적대적 예제를 성공적으로 거부할 수 있다.
  • 제안된 GP 모델 전용 화이트박스 공격 기법은 불확실성 추정을 악용하는 효과적인 적대적 예제를 생성하는 데 성공했다.
  • 수정된 공격 전략은 불확실성 기반 거부를 우회할 수 있었으며, 이는 이러한 방어 수단이 적응형 공격자에게 취약함을 입증했다.
  • 기존 연구(자이브:1812.02606)에서 보여준 바와 같이, 불확실성 기반 방어 수단은 적응형 공격에 취약하며, 이는 단지 모델 불확실성에 의존하는 것의 본질적 한계를 확인시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.