Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Robustness Guarantees for Classification with Gaussian Processes

Arno Blaas, Andrea Patanè|arXiv (Cornell University)|2019. 05. 28.
Gaussian Processes and Bayesian Inference참고 문헌 34인용 수 8
한 줄 요약

이 논문은 유한한 시간 내에 최소 및 최대 클래스 확률에 대한 $\epsilon$-근접 추정치를 보장하는, 고정밀도 입력 집합에 대한 적대적 내성 보장을 계산하기 위해 가우시안 프로세스 분류(GPC) 출력에 대한 분석적 경계를 갖춘 분할 정복 알고리즘을 제안한다. 후행 평균과 분산을 경계 짓기 위해 볼록 최적화를 활용하고, 잠재 공간 이산화를 통해 경계를 정밀화함으로써, 이 방법은 유한한 시간 내에 최소 및 최대 클래스 확률에 대한 $\epsilon$-근접 추정치를 보장하며, 합성 데이터, SPAM, MNIST 데이터셋 전반에 걸쳐 내성 분석과 해석 가능성 분석을 가능하게 한다.

ABSTRACT

We investigate adversarial robustness of Gaussian Process Classification (GPC) models. Given a compact subset of the input space $T\subseteq \mathbb{R}^d$ enclosing a test point $x^*$ and a GPC trained on a dataset $\mathcal{D}$, we aim to compute the minimum and the maximum classification probability for the GPC over all the points in $T$. In order to do so, we show how functions lower- and upper-bounding the GPC output in $T$ can be derived, and implement those in a branch and bound optimisation algorithm. For any error threshold $ε> 0$ selected a priori, we show that our algorithm is guaranteed to reach values $ε$-close to the actual values in finitely many iterations. We apply our method to investigate the robustness of GPC models on a 2D synthetic dataset, the SPAM dataset and a subset of the MNIST dataset, providing comparisons of different GPC training techniques, and show how our method can be used for interpretability analysis. Our empirical analysis suggests that GPC robustness increases with more accurate posterior estimation.

연구 동기 및 목표

  • 가우시안 프로세스 분류(GPC) 모델에 대한 공식적인 적대적 내성 보장이 부족한 문제를 해결하기 위해.
  • 시험점 둘러싸인 컴act 입력 집합에 대해 최소 및 최대 분류 확률을 계산하기 위해.
  • 유한한 시간 내에 분류 확률 범위에 대한 $\epsilon$-근접 경계에 수렴하는 방법을 제공하기 위해.
  • 내성 인식 기반 특성 중요도를 통해 입력 민감도를 정량화함으로써 예측의 해석 가능성 분석을 가능하게 하기 위해.
  • 근사 추론 및 하이퍼파rameter 최적화를 포함한 다양한 GPC 학습 기법의 내성을 비교하기 위해.

제안 방법

  • 잠재 공간을 이산화한 영역에서 가우시안 적분을 최적화하여 GPC 클래스 확률에 대한 분석적 상한 및 하한을 유도한다.
  • 콤팩트 집합 $T$ 위에서 GPC 사후 평균과 분산의 극값을 경계 짓기 위해 볼록 2차 및 선형 프로그래밍을 사용한다.
  • 입력 공간을 재귀적으로 분할하고 $\epsilon$-정확도에 도달할 때까지 경계를 정밀화하는 분할 정복 알고리즘을 구현한다.
  • GPC 출력에 대한 날카운 경계를 계산하기 위해 잠재 공간의 이산화를 활용하여 타당한 전역 최적화를 가능하게 한다.
  • GPC 사후에서의 불확실성 전파를 내성 계산에 통합하여 확률적 보장을 제공한다.
  • 얻어진 경계를 사용하여 분류 범위와 민감도 지표를 계산하고, LIME와 비교하여 해석 가능성 분석을 수행한다.

실험 결과

연구 질문

  • RQ1콤팩트 입력 집합 $T$ 위에서 GPC 모델의 최소 및 최대 분류 확률에 대해 증명 가능하게 날카운 경계를 계산할 수 있는가?
  • RQ2제안된 분할 정복 알고리즘이 유한한 시간 내에 진정한 분류 확률 범위에 대한 $\epsilon$-근접 추정치로 수렴하는가?
  • RQ3근사 베이지안 추론(예: 라플라스 근사 대비 EP)의 선택이 GPC 모델의 적대적 내성에 어떤 영향을 미치는가?
  • RQ4적대적 내성은 LIME과 같은 국소 선형 방법에 비해 GPC 예측의 해석 가능성 향상에 기여하는가?
  • RQ5학습 에포크 수가 GPC 모델의 내성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 임의의 콤팩트 입력 집합에 대해 GPC 분류 확률에 대한 $\epsilon$-근접 경계에 유한한 시간 내에 수렴함을 보장한다.
  • 기대 전파(EP)는 모든 평가된 데이터셋에서 라플라스 근사보다 더 강건한 GPC 모델을 제공한다.
  • GPC의 내성은 학습 에포크 수가 증가할수록 증가하며, 이는 사후 추정의 향상이 적대적 내성에 기여함을 시사한다.
  • 이 방법은 MNIST에서 '3'을 '8'로 바꾸는 데 기여하는 의미 있는 연속된 영역을 식별하며, 이는 모델 행동을 확인한다.
  • SPAM 데이터셋에서는 이 방법이 전역 비선형 관계를 정확히 포착하지만, LIME은 합성2D 데이터셋에서 국소 선형 근사에 의존함으로써 실패한다.
  • $\gamma=2.0$일 때, 제안된 해석 가능성 지표는 LIME보다 비선형 환경에서 더 나은 성능을 보이며 전역 입력-출력 의존성을 포착한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.