Skip to main content
QUICK REVIEW

[논문 리뷰] Combining Ensembles and Data Augmentation can Harm your Calibration

Yeming Wen, Ghassen Jerfel|arXiv (Cornell University)|2020. 10. 19.
Adversarial Robustness in Machine Learning참고 문헌 51인용 수 9
한 줄 요약

이 논문은 앙상블과 데이터 증강(특히 Mixup)을 조합할 경우 소프트 레이블에서 기인한 복합적인 과소신뢰와 가중치 마진화로 인해 모델의 캘리브레이션 성능이 떨어지는 심각한 병태를 규명한다. 이를 해결하기 위해 저자들은 캘리브레이션을 복원하면서 정확도를 향상시키는 클래스 및 예측 수준에서의 적응형 Mixup 계수 조정 기법인 CAMixup을 제안한다. 이는 CIFAR-10, CIFAR-100, ImageNet에서 최신 기준의 불확실성 캘리브레이션을 달성한다.

ABSTRACT

Ensemble methods which average over multiple neural network predictions are a simple approach to improve a model's calibration and robustness. Similarly, data augmentation techniques, which encode prior information in the form of invariant feature transformations, are effective for improving calibration and robustness. In this paper, we show a surprising pathology: combining ensembles and data augmentation can harm model calibration. This leads to a trade-off in practice, whereby improved accuracy by combining the two techniques comes at the expense of calibration. On the other hand, selecting only one of the techniques ensures good uncertainty estimates at the expense of accuracy. We investigate this pathology and identify a compounding under-confidence among methods which marginalize over sets of weights and data augmentation techniques which soften labels. Finally, we propose a simple correction, achieving the best of both worlds with significant accuracy and calibration gains over using only ensembles or data augmentation individually. Applying the correction produces new state-of-the art in uncertainty calibration across CIFAR-10, CIFAR-100, and ImageNet.

연구 동기 및 목표

  • 앙상블과 Mixup 같은 데이터 증강 기법을 병합할 경우 둘 다 개별적으로 캘리브레이션 성능을 향상시키지만 왜 성능 저하가 발생하는지 조사하기 위해.
  • 캘리브레이션 저하의 근본 원인을 규명하기 위해, 특히 Mixup의 소프트 레이블에서 기인한 과소신뢰와 앙상블에서의 가중치 마진화가 병합될 경우 발생하는 복합적인 과소신뢰 효과를 분석하기 위해.
  • 앙상블과 데이터 증강의 이점을 유지하면서도 캘리브레이션 성능을 훼손하지 않는 보정 방법을 개발하기 위해.
  • 다양한 벤치마크에서 최신 기준의 불확실성 캘리브레이션을 달성하면서도 경쟁력 있는 정확도를 유지하기 위해.

제안 방법

  • 검증 세트의 신뢰도(정확도 - 신뢰도) 기반으로 클래스별로 적응적으로 Mixup 계수를 할당하는 CAMixup를 제안하여 과소신뢰 문제를 보정한다.
  • 클래스 수준의 신뢰도에 임계값 기반의 필터링 메커니즘을 적용하여, 각 클래스에 대해 Mixup 적용 여부를 결정함으로써 모든 예측에 대해 균일하게 적용하는 것을 방지한다.
  • 잊혀진 예측 수(Forgetting count)를 활용한 예측 수준의 확장 버전인 CAMixup를 제안하며, 높은 忽略 수를 가진 예측에 대해서만 Mixup를 적용하여 캘리브레이션 성능을 향상시킨다.
  • 온도 스케일링을 CAMixup와 병행하여, 특히 내부 분포 및 외부 분포 데이터에서의 캘리브레이션을 더욱 정교하게 보정한다.
  • 표준 딥러닝 학습 파이프라인을 사용하며, 검증 중 모델 행동에 따라 동적으로 Mixup 계수를 조정하는 방식으로 CAMixup를 통합하여 학습한다.
  • 다양한 앙상블 기법(MC-dropout, BatchEnsemble, Deep Ensembles)과 데이터셋(CIFAR-10, CIFAR-100, ImageNet)을 대상으로 평가하여 방법의 강건성과 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1왜 앙상블과 Mixup를 병합할 경우 둘 다 개별적으로 캘리브레이션 성능을 향상시키지만 전체적으로는 성능 저하가 발생하는가?
  • RQ2왜 앙상블의 가중치 마진화와 Mixup의 레이블 스무스닝이 병합될 경우 과소신뢰 효과가 복합적으로 악화되는가?
  • RQ3동적이고 적응적인 Mixup 계수 전략이 이 상호작용으로 인한 캘리브레이션 저하를 완화할 수 있는가?
  • RQ4제안된 CAMixup 방법이 앙상블 또는 데이터 증강을 별도로 사용할 경우보다 더 나은 캘리브레이션과 정확도를 달성하는가?
  • RQ5이 방법은 다양한 아키텍처와 데이터셋, 특히 ImageNet에서도 일반화 가능한가?

주요 결과

  • 모든 세 가지 앙상블 기법(MC-dropout, BatchEnsemble, Deep Ensembles)에 대해 앙상블과 Mixup를 병합할 경우 캘리브레이션 성능이 뚜렷이 저하되며, CIFAR-10과 CIFAR-100에서 ECE가 크게 증가한다.
  • 근본 원인은 복합적인 과소신뢰 효과이다: Mixup의 소프트 레이블이 부정적인 신뢰도 편향을 유도하며, 이는 앙상블의 가중치 마진화와 병합될 경우 악화된다.
  • CAMixup는 CIFAR-10(0.4% ECE)과 CIFAR-100(2.3% ECE)에서 최신 기준의 캘리브레이션 성능을 달성하며, 개별 기법과의 단순 조합보다 뛰어난 성능을 보인다.
  • ImageNet에서는 CAMixup가 1.5% ECE를 기록하여 새로운 최신 기준을 수립했으며, ResNet-50 기반으로 77.4%의 상위-1 정확도를 유지하면서도 경쟁력 있는 성능을 확보했다.
  • 잊혀진 예측 수 기반의 CAMixup는 CIFAR-10에서 클래스 기반 CAMixup보다 대부분의 지표에서 더 나은 캘리브레이션 성능을 보였지만, CIFAR-100에서는 결과가 일관되지 않았다.
  • 온도 스케일링을 CAMixup와 병행하면 내부 분포 데이터의 캘리브레이션 성능을 더욱 향상시키지만, 외부 분포 데이터의 캘리브레이션 향상에는 유의미한 영향을 미치지 못했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.