Skip to main content
QUICK REVIEW

[논문 리뷰] Make Sure You're Unsure: A Framework for Verifying Probabilistic Specifications

Leonard Berrada, Sumanth Dathathri|arXiv (Cornell University)|2021. 02. 18.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 신경망 내 확률적 사양을 검증하기 위한 새로운 프레임워크를 제안한다. 기능적 승수(레이저랑주안 다중변수)를 사용해 라그랑주 이중성을 일반화함으로써 정확하고 타당하며 완전한 검증을 가능하게 한다. 베이지안 및 몬테카를로 드롭아웃 네트워크에서 적대적 로버스트니 및 분포 외 탐지에 대해 인증된 보장을 크게 향상시키며, 분포 외 탐지에 대해 최대 29%의 인증된 AUC와 MNIST에서 ℓ∞ 로버스트니 정확도 74.6%를 달성한다.

ABSTRACT

Most real world applications require dealing with stochasticity like sensor noise or predictive uncertainty, where formal specifications of desired behavior are inherently probabilistic. Despite the promise of formal verification in ensuring the reliability of neural networks, progress in the direction of probabilistic specifications has been limited. In this direction, we first introduce a general formulation of probabilistic specifications for neural networks, which captures both probabilistic networks (e.g., Bayesian neural networks, MC-Dropout networks) and uncertain inputs (distributions over inputs arising from sensor noise or other perturbations). We then propose a general technique to verify such specifications by generalizing the notion of Lagrangian duality, replacing standard Lagrangian multipliers with "functional multipliers" that can be arbitrary functions of the activations at a given layer. We show that an optimal choice of functional multipliers leads to exact verification (i.e., sound and complete verification), and for specific forms of multipliers, we develop tractable practical verification algorithms. We empirically validate our algorithms by applying them to Bayesian Neural Networks (BNNs) and MC Dropout Networks, and certifying properties such as adversarial robustness and robust detection of out-of-distribution (OOD) data. On these tasks we are able to provide significantly stronger guarantees when compared to prior work -- for instance, for a VGG-64 MC-Dropout CNN trained on CIFAR-10, we improve the certified AUC (a verified lower bound on the true AUC) for robust OOD detection (on CIFAR-100) from $0\% ightarrow 29\%$. Similarly, for a BNN trained on MNIST, we improve on the robust accuracy from $60.2\% ightarrow 74.6\%$. Further, on a novel specification -- distributionally robust OOD detection -- we improve the certified AUC from $5\% ightarrow 23\%$.

연구 동기 및 목표

  • 가중치 또는 입력에서 발생하는 확률적 성격이 존재하는 상황에서도 확률적 사양을 위한 공식 검증 방법의 부족을 해결한다.
  • 출력 분포에 의존하는 성질, 예를 들어 불확실성 하에서의 기대 행동 또는 분포로 안정적인 OOD 탐지와 같은 성질을 검증할 수 있도록 한다.
  • 정확한(타당하고 완전한) 검증과 실용적인 검증을 모두 지원하는 일반적이고 이론적으로 타당한 프레임워크를 제공한다. 이는 검증에 특화된 모델이 아닌 일반 모델에도 적용 가능하다.
  • 기존 방법이 제공하는 허무한 또는 약한 보장보다 기능적 승수를 통해 확률적 제약의 구조를 활용함으로써 더 강력한 보장을 제공한다.

제안 방법

  • 표준 라그랑주 이중성을 일반화하여 스칼라 라그랑주 승수를 중간 레이어의 활성화에 의존하는 기능적 승수로 대체한다.
  • 기능적 승수를 최적화하여 사양 위반에 대한 상한을 강화함으로써 타당하고 완전한 검증이 가능한 이중 최적화 문제를 유도한다.
  • 기능적 승수를 특정 형태(예: 선형 또는 매개변수화된 함수)로 제한함으로써 실용적인 알고리즘을 개발하고, 기울기 기반 최적화 방법을 통해 효율적인 최적화를 가능하게 한다.
  • 베이지안 및 MC-Dropout 네트워크에서 발생하는 확률적 성격으로 인한 이항 연산을 다루기 위해 경계 전파 기법(예: IBP 또는 LBP)과 통합한다.
  • 이중 최적화를 수행하기 위해 외부 루프에서는 Adam을 사용해 기능적 승수를 최적화하고, 내부 루프에서는 적대적 공격 또는 경계 전파를 수행해 최악의 위반 사례를 계산한다.
  • 입력 편향 또는 분포 이탈이 있는 상황에서 적대적 로버스트니 및 OOD 탐지와 같은 성질을 검증하는 데 이 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1가중치와 입력에서의 불확실성을 고려한 신경망 내 확률적 사양을 검증할 수 있는 일반적 프레임워크를 개발할 수 있는가?
  • RQ2기능적 승수를 사용해 스칼라 승수 대신 확률 분포 간의 제약을 다룰 수 있도록 라그랑주 이중성을 어떻게 확장할 수 있는가?
  • RQ3기능적 승수를 통해 스트로스틱 신경망에서 확률적 성질에 대해 정확한 검증(타당하고 완전한 검증)을 얼마나 잘 달성할 수 있는가?
  • RQ4이 프레임워크는 기존 방법보다 훨씬 강력한 인증된 보장을 제공할 수 있는가? 특히 적대적 로버스트니 및 OOD 탐지와 같은 과제에서 말이다.
  • RQ5입력 편향이 전체 분포 집합에서 추출된 경우와 같은 새로운 사양, 예를 들어 분포로 안정적인 OOD 탐지에서 이 프레임워크는 어떻게 성능을 발휘하는가?

주요 결과

  • 검증에 특화된 훈련 없이 CIFAR-10에서 훈련된 VGG-64 MC-Dropout CNN에 대해, CIFAR-100에서의 분포 외 탐지에 대한 인증된 AUC가 0%에서 29%로 향상되었다.
  • MNIST에서 훈련된 베이지안 신경망에 대해, 제안된 프레임워크를 사용함으로써 인증된 ℓ∞ 로버스트니 정확도가 60.2%에서 74.6%로 증가했다.
  • 새로운 분포로 안정적인 OOD 탐지 사양에 대해, 인증된 AUC가 5%에서 23%로 향상되어 이는 복잡한 새로운 확률적 성질에 대한 본 방법의 능력을 입증한다.
  • 간단한 기능적 승수 선택조차도 기존 방법이 흔히 허무한 보장을 제공하는 스트로스틱 환경에서 성능을 뛰어넘는다.
  • 검증에 특화된 모델이 아닌 일반 모델에서도 강력한 검증 성능을 발휘하며, 아키텍처 수정 없이 훈련 후 적용 가능함을 보여준다.
  • 모델 크기에 비례해 검증 시간이 증가하지만 여전히 의미 있는 인증 경계를 제공함—예를 들어 CIFAR-100에서 VGG-64에 대해 8.5k 초가 소요됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.