[논문 리뷰] Improving Calibration through the Relationship with Adversarial Robustness
이 논문은 각 예시의 적대적 내성에 기반해 훈련 레이블을 적응적으로 부드럽게 하는 AR-AdaLS라는 방법을 제안한다. 적대적 내성이 없는 입력이 잘못 校정될 가능성이 더 높다는 점을 발견한 바, AR-AdaLS는 이러한 취약한 예시들에 대해 더 강한 레이블 부드럽힘을 적용함으로써, 추론 지연 없이 안정성 향상과 함께 분포 이탈 상황에서도 크게 향상된 校정 성능을 달성한다.
Neural networks lack adversarial robustness, i.e., they are vulnerable to adversarial examples that through small perturbations to inputs cause incorrect predictions. Further, trust is undermined when models give miscalibrated predictions, i.e., the predicted probability is not a good indicator of how much we should trust our model. In this paper, we study the connection between adversarial robustness and calibration and find that the inputs for which the model is sensitive to small perturbations (are easily attacked) are more likely to have poorly calibrated predictions. Based on this insight, we examine if calibration can be improved by addressing those adversarially unrobust inputs. To this end, we propose Adversarial Robustness based Adaptive Label Smoothing (AR-AdaLS) that integrates the correlations of adversarial robustness and calibration into training by adaptively softening labels for an example based on how easily it can be attacked by an adversary. We find that our method, taking the adversarial robustness of the in-distribution data into consideration, leads to better calibration over the model even under distributional shifts. In addition, AR-AdaLS can also be applied to an ensemble model to further improve model calibration.
연구 동기 및 목표
- 적대적 내성과 모델 校정 간의 관계를 조사하며, 특히 내성이 없는 입력이 잘못 校정될 가능성이 더 높은지 여부를 밝히는 것.
- 훈련 예시의 적대적 내성에 따라 다른 supervision을 제공함으로써 모델 校정을 향상시키는 것.
- 추론 지연 없이 확장 가능하고 효율적인 방법을 개발하여 校정 성능을 향상시키는 것.
- 분포 이탈 상황에서의 추가 校정 향상을 위해 앙상블 모델로 방법을 확장하는 것.
- 적대적 내성 정밀도가 校정 성능에 미치는 영향을 평가하는 것.
제안 방법
- AR-AdaLS는 각 입력의 적대적 내성에 기반해 훈련 레이블을 적응적으로 부드럽게 하며, 더 내성이 있는 예시일수록 더 적은 부드럽힘을 적용한다.
- 적대적 내성은 모델을 속이기 위해 필요한 편향의 크기로 측정되며, 이를 바탕으로 입력을 내성 집합으로 분류한다.
- 레이블 부드럽힘은 집합 단위로 적용되며, 더 취약한 집합일수록 더 강한 부드럽힘을 적용해 과신을 줄인다.
- 사전 계산된 또는 실시간으로 계산된 적대적 내성 추정치를 사용하며, 실시간 추정치는 더 높은 계산 비용을 감수하나 더 우수한 성능을 보인다.
- AR-AdaLS는 '앙상블의 AR-AdaLS'를 통해 앙상블 모델로 확장되며, 앙상블 내 각 기본 모델에 대해 적응적 부드럽힘을 적용한다.
- 방법은 내성도를 불확실성의 대체 지표로 통합하여, 校정 성능과 안정성을 향상시킨다.
실험 결과
연구 질문
- RQ1다양한 데이터셋과 아키텍처에서 적대적 내성과 모델 校정 간에 유의미한 상관관계가 존재하는가?
- RQ2훈련 예시의 적대적 내성에 기반해 적응적 레이블 부드럽힘을 적용함으로써 校정 성능 향상을 달성할 수 있는가?
- RQ3적대적 내성 추정 정밀도가 AR-AdaLS의 校정 성능에 미치는 영향은 어떠한가?
- RQ4표준 레이블 부드럽힘과 앙상블 기법에 비해 AR-AdaLS는 분포 이탈 데이터에서 校정 성능을 향상시키는가?
- RQ5딥 앙상블 모델에 적용했을 때 AR-AdaLS는 추가적인 校정 향상을 이룰 수 있는가?
주요 결과
- 적대적으로 내성이 없는 입력은 잘못 校정되고 불안정할 가능성이 뚜렷하게 높으며, ECE와 예측 분산도 높다.
- CIFAR-100에서 AR-AdaLS는 ECE를 기존 방식의 6.1에서 2.3으로, 오염된 데이터에서 cECE를 18.2에서 13.2로 감소시켜 표준 레이블 부드럽힘과 온도 스케일링을 능가한다.
- 실시간 적대적 내성 추정치를 사용할 경우 사전 계산된 내성 추정치보다 더 우수한 校정 성능을 보였으며, ablation 연구에서 cECE는 13.2로 감소했고, 14.2로 상대적으로 낮아졌다.
- 10개의 내성 집합을 사용한 AR-AdaLS는 안정적인 성능을 보였으며, R=10을 초과해도 성능 향상이 거의 없어 집합 수에 대해 강건함을 입증했다.
- AR-AdaLS는 독립적인 실행 간 예측 분산을 감소시켜 실무 적용에서 모델의 안정성을 향상시켰다.
- 앙상블에 적용했을 때, AR-AdaLS of Ensemble는 표준 앙상블을 초월해 추가적인 校정 향상을 이룩했으며, 특히 분포 이탈 상황에서 두드러진 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.