[논문 리뷰] Improving Calibration in Mixup-trained Deep Neural Networks through Confidence-Based Loss Functions.
이 논문은 믹스업 훈련된 딥 네ural 네트워크에서 校정을 향상시키기 위해 신뢰도 기반 손실 함수를 제안하며, 베이즈 결론 이론을 바탕으로 믹스업의 본질적 校정 단점들을 보완한다. 이 방법은 벤치마크 전반에서 일관되고 측정 가능한 校정 향상과 함께 최신 기술 수준의 정확도를 달성한다.
Deep Neural Networks (DNN) represent the state of the art in many tasks. However, due to their overparameterization, their generalization capabilities are in doubt and are still under study. Consequently, DNN can overfit and assign overconfident predictions, as they tend to learn highly oscillating decision thresholds. This has been shown to affect the calibration of the confidences assigned to unseen data. Data Augmentation (DA) strategies have been proposed to overcome some of these limitations. One of the most popular is Mixup, which has shown a great ability to improve the accuracy of these models. Recent work has provided evidence that Mixup also improves the uncertainty quantification and calibration of DNN. In this work, we argue and provide empirical evidence that, due to its fundamentals, Mixup does not necessarily improve calibration. Based on our observations we propose a new loss function that improves the calibration, and also sometimes the accuracy. Our loss is inspired by Bayes decision theory and introduces a new training framework for designing losses for probabilistic modelling. We provide state-of-the-art accuracy with consistent improvements in calibration performance.
연구 동기 및 목표
- 믹스업 훈련된 딥 네럴 네트워크에서 정확도 향상에도 불구하고 지속적인 校정 문제를 해결하기 위해.
- 믹스업이 정확도와 불확실성 추정을 향상시키지만 일관되게 校정을 향상시키지 못하는 이유를 조사하기 위해.
- 베이즈 결론 이론에 기반한 새로운 손실 함수를 개발하여 정확도를 희생시키지 않고도 신뢰도 校정을 향상시키기 위해.
- 확률적 딥 러닝에서 校정 인식 손실 함수를 설계하기 위한 일반화 가능한 훈련 프레임워크를 제공하기 위해.
제안 방법
- 베이즈 결론 이론을 영감으로 삼아 직접 잘 校정된 신뢰도 점수를 최적화하기 위한 새로운 보편적 신뢰도 기반 손실 함수를 제안한다.
- 예측 불확실성에 기반한 신뢰도 페널티를 통합하여 표준 크로스 엔트로피 손실을 수정하는 훈련 프레임워크를 도입한다.
- 표준 크로스 엔트로피와 신뢰도 정규화의 가중 조합을 사용하여 정확도와 校정 간 균형을 맞춘다.
- 훈련 중에 과신한 예측에 더 강하게 페널티를 주는 동적 신뢰도 가중치 기반 방식을 구현한다.
- 외부 분포 데이터에서 믹스업이 과신한 예측을 유도하는 경향을 보완하기 위해 새로운 손실을 믹스업 훈련 중에 적용한다.
- 정확도를 유지하거나 향상시키면서도 잘못된 校정을 명시적으로 최소화하는 校정 인식 훈련 목표를 도입한다.
실험 결과
연구 질문
- RQ1믹스업은 본질적으로 모델의 校정을 향상시키는가, 아니면 정확도와 불확실성 추정에만 유의미한 기여를 하는가?
- RQ2믹스업 훈련된 모델에서 관찰되는 校정 한계의 근본적 이유는 무엇인가?
- RQ3베이즈 결론 이론에서 유도된 신뢰도 기반 손실 함수가 정확도를 떨어뜨리지 않고도 校정을 효과적으로 향상시킬 수 있는가?
- RQ4제안된 손실 함수는 다양한 데이터셋과 모델 아키텍처에서 정확도 및 校정 측면에서 어떻게 성능을 발휘하는가?
주요 결과
- 믹스업은 정확도와 불확실성 측정 향상 효과는 있으나, 일관되게 모델의 校정을 향상시키지 못한다.
- 제안된 신뢰도 기반 손실 함수는 여러 벤치마크 데이터셋에서 校정 성능을 크게 향상시킨다.
- 예상 校정 오차(ECE)로 측정했을 때, 이 방법은 최신 기술 수준의 정확도를 달성하면서 동시에 뛰어난 校정 성능을 제공한다.
- 실험 결과는 다양한 모델 아키텍처와 데이터 분포에서 일관된 校정 향상이 이루어짐을 보여준다.
- 손실 함수는 특히 외부 분포 샘플에서 과신한 예측을 효과적으로 줄인다.
- 훈련 프레임워크는 모델의 신뢰도를 실제 예측 신뢰성과 일치시켜 더 나은 일반화를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.