Skip to main content
QUICK REVIEW

[논문 리뷰] Diverse Ensembles Improve Calibration

Asa Cooper Stickland, Iain Murray|arXiv (Cornell University)|2020. 07. 08.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 13
한 줄 요약

이 논문은 딥 네ural 네트워크 앙상블에서 모델 캘리브레이션을 향상시키기 위해 각 앙상블 멤버에 맞게 특화된 다양한 데이터 증강 기법(예: 적대적 편향, AugMix, 스토하스틱 디pth)을 적용하는 단순하면서도 효과적인 방법을 제안한다. 추가로, 작은 확률로 증강되지 않은 입력을 혼합함으로써, i.i.d. 및 분포 외 데이터 모두에서 캘리브레이션과 정확도가 향상되며, CIFAR-10 및 CIFAR-100 벤치마크에서 강력한 베이스라인을 능가한다.

ABSTRACT

Modern deep neural networks can produce badly calibrated predictions, especially when train and test distributions are mismatched. Training an ensemble of models and averaging their predictions can help alleviate these issues. We propose a simple technique to improve calibration, using a different data augmentation for each ensemble member. We additionally use the idea of `mixing' un-augmented and augmented inputs to improve calibration when test and training distributions are the same. These simple techniques improve calibration and accuracy over strong baselines on the CIFAR10 and CIFAR100 benchmarks, and out-of-domain data from their corrupted versions.

연구 동기 및 목표

  • 분포 이탈 상황에서의 잘못된 예측 문제를 해결하기 위해.
  • 계산 비용을 증가시키지 않고도 앙상블 모델의 캘리브레이션과 일반화 성능을 향상시키기 위해.
  • 각 앙상블 멤버에 대해 다양한 데이터 증강 기법을 적용함으로써 모델 캘리브레이션 향상 여부를 조사하기 위해.
  • 증강된 입력과 증강되지 않은 입력을 혼합함으로써 캘리브레이션 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 각 앙상블 멤버에 대해 다른 데이터 증강 기법(적대적 편향, AugMix, 스토하스틱 디프스)을 적용하여 다양성을 증가시킨다.
  • 대부분의 모델 파라미터를 공유함으로써 훈련 및 저장 비용을 줄이기 위해 BatchEnsemble를 사용한다.
  • 랜덤 혼합 전략을 도입: 확률 p로 증강되지 않은 입력을 사용하고, 그렇지 않으면 증강된 입력을 사용한다.
  • 적대적 편향의 경우, 무작위 스케일링과 드롭아웃 유사 마스킹을 적용한 수정된 빠른 기울기 부호 방법을 사용해 입력을 생성한다.
  • AugMix의 경우, 원래 방법을 단순화하여 베타 분포 대신 베르누이 시험을 통해 원본 이미지와 증강된 이미지 중 하나를 선택한다.
  • 각 앙상블 멤버를 효율적으로 파arameter화하기 위해 학습 가능한 적응 벡터 r_i와 s_i를 가진 공유 가중치 행렬 W를 사용한다.

실험 결과

연구 질문

  • RQ1각 앙상블 멤버에 대해 다른 데이터 증강 기법을 적용할 경우, i.i.d. 및 분포 외 데이터에서 모델 캘리브레이션 성능이 향상되는가?
  • RQ2증강된 입력과 증강되지 않은 입력을 혼합할 경우, i.i.d. 테스트 세트에서 캘리브레이션과 정확도에 어떤 영향을 미치는가?
  • RQ3훈련 및 테스트 분포가 다를 경우, 각 멤버에 대해 다양한 증강 기법을 적용함으로써 잘못된 캘리브레이션을 줄일 수 있는가?
  • RQ4증강 전략의 선택(예: 적대적 vs. AugMix)이 손상된 데이터에서 성능에 영향을 미치는가?
  • RQ5성능 향상의 원인은 앙상블 다양성 증가 때문인가, 아니면 특정 형태의 데이터 증강 때문인가?

주요 결과

  • 각 앙상블 멤버에 대해 다른 증강 강도를 적용함으로써, 비다양성 앙상블 대비 CIFAR-10-C에서 ECE가 1.4%p 감소하고, CIFAR-100-C에서는 1.2%p 감소하였다.
  • 증강되지 않은 입력을 혼합함(p=0.875)으로 인해 i.i.d. 데이터에서 캘리브레이션 성능이 향상되었으며, 항상 증강을 적용한 경우 대비 CIFAR-10에서 ECE가 0.3%p 감소하였다.
  • 적대적 편향과 AugMix의 조합이 가장 우수한 성능을 보였으며, CIFAR-10-C에서 10.9%의 오차율을 기록하여 Hendrycks 등(2020)의 34.9% 오차율을 능가하였다.
  • 다양한 증강 기법을 적용한 앙상블은 분포 외 데이터에서 비다양성 앙상블 대비 일관되게 더 나은 캘리브레이션 성능를 보였지만, 정확도는 유사했다.
  • 증강된 입력만 사용할 경우(p=1.0), i.i.d. 데이터에서 성능이 악화되어, 분포 내 예시에 노출되는 것이 캘리브레이션에 필수적임을 시사한다.
  • 이 방법은 CIFAR-10 및 CIFAR-100에서 강력한 베이스라인을 능가하여, 모든 벤치마크에서 캘리브레이션과 정확도 면에서 최신 기준 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.