Skip to main content
QUICK REVIEW

[논문 리뷰] On the Reproducibility of Neural Network Predictions

Srinadh Bhojanapalli, Michael J. Wilber|arXiv (Cornell University)|2021. 02. 05.
Neural Networks and Applications참고 문헌 34인용 수 17
한 줄 요약

이 논문은 학습의 무작위성으로 인한 신경망의 예측 혼란을 다루며, 최소 엔트로피 정규화를 통한 예측 신뢰도 향상과 대칭 KL 기반 공동 디스틸레이션을 활용한 새로운 방법을 제안한다. 이 방법은 ImageNet에서 혼란을 최대 50% 감소시키며 정확도와 校정성( calibration)을 향상시키며, 표준 디스틸레이션 및 앙상블 기법보다 더 낮은 학습 비용으로 성능을 뛰어넘는다.

ABSTRACT

Standard training techniques for neural networks involve multiple sources of randomness, e.g., initialization, mini-batch ordering and in some cases data augmentation. Given that neural networks are heavily over-parameterized in practice, such randomness can cause {\em churn} -- for the same input, disagreements between predictions of the two models independently trained by the same algorithm, contributing to the `reproducibility challenges' in modern machine learning. In this paper, we study this problem of churn, identify factors that cause it, and propose two simple means of mitigating it. We first demonstrate that churn is indeed an issue, even for standard image classification tasks (CIFAR and ImageNet), and study the role of the different sources of training randomness that cause churn. By analyzing the relationship between churn and prediction confidences, we pursue an approach with two components for churn reduction. First, we propose using \emph{minimum entropy regularizers} to increase prediction confidences. Second, \changes{we present a novel variant of co-distillation approach~\citep{anil2018large} to increase model agreement and reduce churn}. We present empirical results showing the effectiveness of both techniques in reducing churn while improving the accuracy of the underlying model.

연구 동기 및 목표

  • 같은 아키텍처와 데이터를 사용함에도 불구하고 딥 신경망에서 발생하는 예측 혼란의 근본 원인을 규명하는 것.
  • 학습의 무작위성(예: 가중치 초기화 및 미니배치 순서)이 테스트 예제에서 모델 간 불일치에 미치는 영향을 정량화하는 것.
  • 무작위성을 제거하지 않고도 학습 런에 걸쳐 안정적인 예측을 확보할 수 있는 방법을 개발하는 것.
  • 정규화와 디스틸레이션을 통해 예측 신뢰도와 일치도를 향상시켜 실세계 머신러닝 응용에서의 재현 가능성을 높이는 것.
  • 혼란 감소, 校정성( calibration), 정확도 사이의 상호 교환 관계를 평가하며, 기존의 디스틸레이션 및 앙상블 기법과의 비교 분석을 수행하는 것.

제안 방법

  • 학습 중 모델 출력의 엔트로피를 최소화하여 예측 신뢰도를 높이는 최소 엔트로피 정규화를 도입한다.
  • 두 학생 모델 간 예측을 정렬하기 위해 대칭 쿨백-라이블러(SKL) 발산을 손실 함수로 사용하는 새로운 공동 디스틸레이션 프레임워크를 제안한다.
  • 엔트로피 정규화와 S KL 기반 공동 디스틸레이션을 하나의 학습 목표로 통합하여 신뢰도와 일치도를 동시에 향상시킨다.
  • 두 모델가 동시에 동일한 데이터와 지식 디스틸레이션 손실을 공유하는 이중 브랜치 학습 설정을 구현한다.
  • 교차 엔트로피 손실, 엔트로피 정규화, 대칭 KL 손실의 가중 조합을 사용하여 정확도, 신뢰도, 일치도 간 균형을 맞춘다.
  • CIFAR-10, CIFAR-100, SVHN, iNaturalist, ImageNet 등 여러 벤치마크에서 방법을 적용하고, 하이퍼파라미터 및 가중치 감쇠에 대한 분석 연구를 수행한다.

실험 결과

연구 질문

  • RQ1표준 확률적 최적화로 학습된 신경망에서 예측 혼란의 주요 원인은 무엇인가?
  • RQ2모델 예측 신뢰도와 혼란 간 상관관계는 어떻게 되며, 신뢰도를 향상시키면 독립적으로 학습된 모델 간 불일치를 줄일 수 있는가?
  • RQ3대칭 KL 발산을 사용한 공동 디스틸레이션은 기존의 교차 엔트로피 기반 디스틸레이션보다 예측 분산과 모델 불일치를 더 효과적으로 줄일 수 있는가?
  • RQ4엔트로피 정규화와 대칭 KL 기반 공동 디스틸레이션을 결합하면 개별 구성 요소나 기존 방법보다 더 나은 혼란 감소 및 정확도 향상을 이룰 수 있는가?
  • RQ5제안된 방법은 특히 레이블 스무딩 및 앙상블 디스틸레이션과 비교했을 때 모델의 校정성( calibration)에 어떤 영향을 미치는가?

주요 결과

  • 고정된 데이터와 아키텍처 조건에서도 예측 혼란은 여전히 심각하며, ImageNet에서 5개의 독립적으로 학습된 ResNet-v2-50 모델 간 최대 20%의 불일치가 관찰되었다.
  • 제안된 대칭 KL 기반 공동 디스틸레이션(Co-distill_SKL)은 기준선 대비 ImageNet에서 혼란을 50% 감소시켰으며, 표준 Co-distill_CE 방법을 능가했다.
  • 최소 엔트로피 정규화는 예측 신뢰도 향상을 통해 혼란을 감소시켰지만, 校정성 오차(ECE)는 증가시켰다( ImageNet에서 3.71에서 6.17로 상승).
  • 엔트로피 정규화와 Co-distill_SKL의 병합된 방법은 가장 낮은 혼란도를 기록했으며, 경쟁 가능한 정확도를 확보했고, ImageNet에서 ECE는 3.89를 기록했다—2-앙상블 디스틸레이션의 2.14 수준에 가깝지만 학습 비용은 절반 수준이었다.
  • Co-distill_SKL은 ImageNet에서 ECE를 Co-distill_CE의 11.97에서 2.44로 감소시켜, 낮은 신뢰도에도 불구하고 校정성( calibration) 향상을 보였다.
  • 분석 연구를 통해 두 구성 요소의 상호 보완성이 확인되었으며, 엔트로피 정규화는 엔트로피를 감소시키고, 공동 디스틸레이션은 예측 분산을 줄여 조합 시 뛰어난 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.