[논문 리뷰] Improving Uncertainty Estimates through the Relationship with Adversarial Robustness.
이 논문은 훈련 중 적대적 공격에 취약한 입력에 대해 적대적 내성에 기반한 적응형 라벨 스무딩을 통해 모델의 校정성과 불확실성 안정성을 향상시키는 AR-AdaLS 방법을 제안한다. 적대적 공격에 취약한 입력은 일반적으로 나쁜 불확실성 추정을 보이므로, 이 방법은 분포 이탈 조건에서도 校정성과 내성 모두를 향상시킨다. 앙상블 설정에서도 성능 향상이 이루어진다.
Robustness issues arise in a variety of forms and are studied through multiple lenses in the machine learning literature. Neural networks lack adversarial robustness -- they are vulnerable to adversarial examples that through small perturbations to inputs cause incorrect predictions. Further, trust is undermined when models give miscalibrated or unstable uncertainty estimates, i.e. the predicted probability is not a good indicator of how much we should trust our model and could vary greatly over multiple independent runs. In this paper, we study the connection between adversarial robustness, predictive uncertainty (calibration) and model uncertainty (stability) on multiple classification networks and datasets. We find that the inputs for which the model is sensitive to small perturbations (are easily attacked) are more likely to have poorly calibrated and unstable predictions. Based on this insight, we examine if calibration and stability can be improved by addressing those adversarially unrobust inputs. To this end, we propose Adversarial Robustness based Adaptive Label Smoothing (AR-AdaLS) that integrates the correlations of adversarial robustness and uncertainty into training by adaptively softening labels conditioned on how easily it can be attacked by adversarial examples. We find that our method, taking the adversarial robustness of the in-distribution data into consideration, leads to better calibration and stability over the model even under distributional shifts. In addition, AR-AdaLS can also be applied to an ensemble model to achieve the best calibration performance.
연구 동기 및 목표
- 딥 네ural 네트워크에서 적대적 내성, 예측 불확실성 校정성, 모델 불확실성 안정성 간의 관계를 조사하는 것.
- 작은 변형에 민감한 입력에서 모델이 자주 잘못 校정되고 불안정한 불확실성 추정을 내는 문제를 해결하는 것.
- 적대적 공격에 취약한 입력을 대상으로 재학습하여 불확실성 추정을 향상시키는 것.
- 적대적 내성을 기반으로 한 적응형 라벨 스무딩을 통해 불확실성 校정성에 내성성을 통합하는 훈련 방법을 개발하는 것.
- 분포 이탈 조건과 앙상블 모델에서의 방법의 효과성을 평가하는 것.
제안 방법
- 적대적 내성 기반 적응형 라벨 스무딩(AR-AdaLS)을 도입하여, 모델의 적대적 예외에 대한 취약도에 따라 라벨 스무딩을 동적으로 조정한다.
- 각 입력에 대해 작은 변형에 의해 쉽게 공격받을 수 있는지 여부를 나타내는 적대적 내성 점수를 계산한다.
- 내성 점수가 낮은(즉, 쉽게 공격받는) 입력은 더 높은 라벨 스무딩을 받으며, 이는 과신을 줄이고 불확실성 校정성을 향상시킨다.
- 라벨 스무딩은 훈련 중 정규화 기법으로 적용되어 취약한 입력에서 더 나은 불확실성 추정을 유도한다.
- 이 방법은 단일 모델과 앙상블 모델 모두와 호환되며, 다양한 환경에서 성능 향상을 이룬다.
- 적대적 취약성과 나쁜 불확실성 간의 상관관계를 활용하여, 추론 시 보정이 필요 없이 신뢰성 있는 불확실성 추정을 향상시킨다.
실험 결과
연구 질문
- RQ1딥 네럴 네트워크에서 적대적 내성, 예측 불확실성 校정성, 모델 불확실성 안정성은 어떻게 관련되어 있는가?
- RQ2분포 내 데이터에서의 적대적 내성 향상이 더 나은 불확실성 추정으로 이어질 수 있는가?
- RQ3적대적 취약성에 조건화된 적응형 라벨 스무딩이 분포 이탈 조건에서 校정성과 안정성을 향상시키는가?
- RQ4AR-AdaLS는 앙상블 모델에 효과적으로 적용되어 불확실성 校정성을 추가로 향상시킬 수 있는가?
- RQ5이 방법은 정확도나 내성도를 희생시키지 않고 불확실성 신뢰성을 향상시키는가?
주요 결과
- 적대적 공격에 취약한 입력은 더 나쁜 校정성과 불안정한 불확실성 추정을 보일 가능성이 높다.
- 제안된 AR-AdaLS 방법은 훈련 중 적대적으로 내성 없는 입력에 초점을 맞추어 校정성과 불확실성 안정성을 모두 향상시킨다.
- 테스트 데이터의 분포가 훈련 데이터의 분포에서 벗어나도 AR-AdaLS는 더 나은 불확실성 校정성을 달성한다.
- 앙상블 모델에서 적대적 내성을 라벨 스무딩에 통합함으로써 AR-AdaLS는 최신 기술 수준의 校정성 성능을 달성한다.
- 적응형 라벨 스무딩 메커니즘은 취약한 입력에서의 과신을 효과적으로 줄여 신뢰성을 향상시키며, 내성도를 손상시키지 않는다.
- 적대적 취약성과 나쁜 불확실성 간의 상관관계는 AR-AdaLS가 불확실성 향상에 체계적인 접근임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.