[논문 리뷰] Bayesian Inference with Certifiable Adversarial Robustness
이 논문은 입력 주변의 에프실론-구 내 최악의 경우 변형을 고려하기 위해 우도 함수를 수정함으로써, 인증 가능한 적대적 로버스트성을 갖는 딥 네ural 네트워크를 훈련하기 위한 베이지안 프레임워크를 제안한다. 간격 경계 전파(IBP)를 사용하여 인증 가능한 하한을 계산함으로써, MNIST, FashionMNIST, CIFAR-10에서 인증 가능한 로버스트한 베이지안 신경망의 훈련을 처음으로 가능하게 하였으며, MNIST에서 최대 75%의 인증 가능한 로버스트 정확도를 달성하고 불확실성 캘리브레이션을 향상시켰다.
We consider adversarial training of deep neural networks through the lens of Bayesian learning, and present a principled framework for adversarial training of Bayesian Neural Networks (BNNs) with certifiable guarantees. We rely on techniques from constraint relaxation of non-convex optimisation problems and modify the standard cross-entropy error model to enforce posterior robustness to worst-case perturbations in $ε$-balls around input points. We illustrate how the resulting framework can be combined with methods commonly employed for approximate inference of BNNs. In an empirical investigation, we demonstrate that the presented approach enables training of certifiably robust models on MNIST, FashionMNIST and CIFAR-10 and can also be beneficial for uncertainty calibration. Our method is the first to directly train certifiable BNNs, thus facilitating their deployment in safety-critical applications.
연구 동기 및 목표
- 적대적 공격에 대해 인증 가능한 로버스트성을 갖는 BNN을 훈련하기 위한 원리적인 베이지안 방법의 부족을 해결하기 위해.
- 입력 주변의 에프실론-구 내 최악의 경우 변형에 대한 사후 분포의 로버스트성을 강제하는 로버스트 우도 모델을 개발하기 위해.
- 기존의 근사 추론 기법들(예: Bayes-by-Backprop 및 SWAG)과의 통합을 위해 이 로버스트 우도를 통합하기 위해.
- 이 방법이 비트레이스러운 인증 가능한 로버스트성과 표준 벤치마크에서의 불확실성 캘리브레이션 향상을 실증적으로 검증하기 위해.
- 로버스트 훈련이 매개변수 공간 내 더 로버스트한 영역으로 BNN 사후분포를 이동시키는 영향을 보여주기 위해.
제안 방법
- 사용자 정의 확률 밀도를 에프실론-구 위에 근거하여 네트워크 출력을 적분함으로써, 표준 교차 엔트로피를 적대적 로버스트성으로 일반화한 로버스트 우도 함수를 제안한다.
- 제약 조건 완화와 간격 경계 전파(IBP)를 사용하여, 임의의 ε > 0에 대해 로버스트 우도의 인증 가능한 하한을 계산한다.
- HMC, BBB, SWAG, NoisyAdam, VOGN 등의 표준 근사 추론 방법과 통합이 가능한 방식으로, 우도 모델을 미분 가능하게 수정한다.
- 로버스트 우도를 사용하여 BNN을 훈련함으로써, 적대적 변형에 대해 본질적으로 로버스트한 사후 추론이 가능하게 한다.
- 훈련 및 평가 중에 IBP를 적용하여 인증 가능한 로버스트성 한계를 계산함으로써, 로버스트 정확도에 대한 공식적 보장을 확보한다.
- 표준 지표(예: 인증 가능한 로버스트 정확도 및 불확실성 캘리브레이션을 위한 예측 엔트로피)를 사용하여 MNIST, FashionMNIST, CIFAR-10에서 방법을 평가한다.
실험 결과
연구 질문
- RQ1원리적인 베이지안 프레임워크를 개발하여 BNN을 인증 가능한 적대적 로버스트성으로 훈련시킬 수 있는가?
- RQ2표준 교차 엔트로피 우도를 어떻게 확장하여 에프실론-구 내 최악의 경우 변형에 대한 로버스트성을 강제할 수 있는가?
- RQ3간격 경계 전파(IBP)를 사용하여 BNN의 근사 추론을 위한 로버스트 우도의 인증 가능한 하한을 계산할 수 있는가?
- RQ4로버스트 우도로 BNN을 훈련하면 분포 외 데이터에 대한 불확실성 캘리브레이션에 어떤 영향을 미치는가?
- RQ5로버스트 훈련이 다양한 에프실론 값에 대해 최대 안전 반경(즉, 로버스트성)에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 ε=0.1일 때 MNIST에서 최대 75%의 인증 가능한 로버스트 정확도를 달성하여, BNN에서 처음으로 비트레이스러운 인증 가능한 로버스트성을 입증하였다.
- FashionMNIST에서는 ε=0.1일 때 최대 73%의 인증 가능한 로버스트 정확도를 달성하여, 다양한 데이터셋 간의 강력한 일반화 성능을 보였다.
- CIFAR-10에서는 ε=1/255일 때 최대 50%의 인증 가능한 로버스트 정확도를 달성하여, 최신의 결정론적 모델과 유사한 성능을 보였다.
- 로버스트 우도로 훈련된 BNN의 최대 인증 가능한 안전 반경은 표준 우도로 훈련된 모델의 약 두 배였다.
- 로버스트 훈련은 불확실성 캘리브레이션을 크게 향상시켰으며, 분포 외 샘플(예: MNIST 훈련 모델에 대한 FashionMNIST, CIFAR-10 훈련 모델에 대한 SVHN)에서 엔트로피가 증가하였다.
- CIFAR-10에서 표준 BNN은 분포 내 데이터보다 분포 외 데이터에 대해 더 확신을 갖는 경향이 있었지만, 로버스트 훈련은 이 경향을 뒤집어 더 잘 캘리브레이션된 불확실성을 나타내었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.