[논문 리뷰] Diversity regularization in deep ensembles
이 논문은 예측 정확도를 훼손하지 않으면서 모델 캘리브레이션을 향상시키기 위해 딥 네ural 네트워크 앙상블을 음성 상관관계(NC) 정규화로 훈련하는 방법을 제안한다. 손실 함수에 다양성 정규화 항을 명시적으로 도입하여 앙상블 구성원 간의 다양성을 강제함으로써, 특히 더 큰 앙상블 크기에서 기대 캘리브레이션 오차(ECE)를 크게 감소시킨다. 이는 CIFAR-100 및 CIFAR-10 데이터셋에서 높은 예측 성능를 유지하면서도 성능을 향상시킨다.
Calibrating the confidence of supervised learning models is important for a variety of contexts where the certainty over predictions should be reliable. However, it has been reported that deep neural network models are often too poorly calibrated for achieving complex tasks requiring reliable uncertainty estimates in their prediction. In this work, we are proposing a strategy for training deep ensembles with a diversity function regularization, which improves the calibration property while maintaining a similar prediction accuracy.
연구 동기 및 목표
- 딥 네트워크에서의 열악한 캘리브레이션 문제, 특히 앙상블 크기가 증가함에 따라 모델이 과소신뢰가 되는 앙상블 설정에서의 문제를 해결하기 위해.
- 예측 정확도를 저하시키지 않으면서 딥 앙상블의 캘리브레이션 성능을 향상시키기 위해.
- 음성 상관관계(NC) 정규화를 통해 앙상블 구성원 간의 다양성을 명시적으로 강제하면 캘리브레이션 성능이 향상되는지 조사하기 위해.
- 다양한 앙상블 크기와 데이터셋에서 NC 정규화의 효과를 평가하기 위해.
제안 방법
- 훈련 중 각 앙상블 구성원의 손실 함수에 음성 상관관계(NC) 기반의 다양성 정규화 항을 도입한다.
- 다양성 지표는 각 네트워크의 출력이 앙상블 평균에서 벗어난 정도와 다른 네트워크들의 평균에서의 편차 합의 곱으로 정의된다.
- 역전파 과정에서 앙상블 평균은 각 개별 네트워크에 대해 상수로 간주되어 안정적인 기울기 갱신이 가능하다.
- 각 네트워크의 총 손실은 교차 엔트로피 분류 손실과 하이퍼파rameter λ를 가중치로 갖는 다양성 정규화 항의 합으로 구성된다.
- 최종 예측은 앙상블 내 M개의 네트워크 출력을 평균하여 도출된다.
- 이 방법은 CIFAR-100에서 배치 정규화를 적용한 VGG-11과 CIFAR-10에서 수정된 AlexNet을 대상으로 평가된다.
실험 결과
연구 질문
- RQ1음성 상관관계 정규화를 통해 딥 앙상블 구성원 간의 다양성을 강제하면 모델 캘리브레이션 성능이 향상되는가?
- RQ2다양한 앙상블 크기에서 NC 정규화된 앙상블과 순수 앙상블 간의 기대 캘리브레이션 오차(ECE)와 정확도를 비교하면 어떻게 되는가?
- RQ3NC 정규화는 큰 순수 앙상블에서 관찰되는 과소신뢰 문제를 완화할 수 있는가?
- RQ4특히 복잡한 분류 과제에서, 캘리브레이션 향상과 함께 높은 정확도를 유지할 수 있는가?
주요 결과
- M=7일 때 NC-정규화된 앙상블은 CIFAR-100에서 ECE 2.5%를 기록하여 동일 조건에서 순수 앙상블의 4.3%보다 유의미하게 낮게 나타났다.
- M=11일 때 NC-정규화된 앙상블은 ECE를 3.9%로 감소시켰고, 순수 앙상블은 6.9%였으며, 이는 스케일이 증가함에 따라 캘리브레이션 성능 향상이 뚜렷하게 나타남을 보여준다.
- 정확도는 유지되었으며, NC-정규화된 앙상블은 0.7096, 순수 앙상블은 0.7146을 기록하여 성능 저하가 없음을 확인했다.
- CIFAR-100의 'people' 슈퍼클래스에서 NC-정규화된 앙상블은 신뢰도-정확도 차이가 단지 0.02였고, 순수 앙상블은 0.05였으며, 이는 더 나은 캘리브레이션을 의미한다.
- 단일 네트워크 기준선은 과신뢰(평균 차이 0.12)였고, 순수 앙상블은 과소신뢰(0.05)였지만, NC 정규화로 평균 차이는 0.02로 낮아져 균형 잡힌 신뢰도 추정이 이루어졌다.
- 이 방법은 과신뢰와 과소신뢰 문제를 효과적으로 완화하였으며, NC-정규화된 앙상블은 모든 클래스에서 균형 잡힌 신뢰도 추정을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.