Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Inference for Large Scale Image Classification

Jonathan Heek, Nal Kalchbrenner|arXiv (Cornell University)|2019. 08. 09.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 16
한 줄 요약

이 논문은 대규모 이미지 분류 작업에서 베이지안 추론을 가능하게 하는 적응형 노이즈 마르코프 체인 몽테카를로(MCMC) 샘플러인 ATMC를 소개한다. 이는 훈련 중에 동적으로 운동량과 노이즈를 조정함으로써 성능을 향상시킨다. ATMC는 배치 정규화 없이도 ImageNet과 CIFAR-10에서 최적화 기반 방법을 능가하며, 사후 예측 샘플링을 통해 더 높은 정확도와 더 나은 불확실성 캘리브레이션을 달성한다.

ABSTRACT

Bayesian inference promises to ground and improve the performance of deep neural networks. It promises to be robust to overfitting, to simplify the training procedure and the space of hyperparameters, and to provide a calibrated measure of uncertainty that can enhance decision making, agent exploration and prediction fairness. Markov Chain Monte Carlo (MCMC) methods enable Bayesian inference by generating samples from the posterior distribution over model parameters. Despite the theoretical advantages of Bayesian inference and the similarity between MCMC and optimization methods, the performance of sampling methods has so far lagged behind optimization methods for large scale deep learning tasks. We aim to fill this gap and introduce ATMC, an adaptive noise MCMC algorithm that estimates and is able to sample from the posterior of a neural network. ATMC dynamically adjusts the amount of momentum and noise applied to each parameter update in order to compensate for the use of stochastic gradients. We use a ResNet architecture without batch normalization to test ATMC on the Cifar10 benchmark and the large scale ImageNet benchmark and show that, despite the absence of batch normalization, ATMC outperforms a strong optimization baseline in terms of both classification accuracy and test log-likelihood. We show that ATMC is intrinsically robust to overfitting on the training data and that ATMC provides a better calibrated measure of uncertainty compared to the optimization baseline.

연구 동기 및 목표

  • ImageNet과 같은 대규모 이미지 분류 작업에서 MCMC 샘플링을 가능하게 하여 베이지안 딥러닝의 확장성 격차를 해소한다.
  • 배치 정규화나 드롭아웃과 같은 확률적 정규화 기법과 호환되지 않는 MCMC 방법의 문제를 해결한다.
  • 초파rameter 민감도를 줄이고 과적합에 더 내재적으로 강건한 샘플링 알고리즘을 개발한다.
  • ATMC의 사후 예측 추정치가 정확도와 로그우도 모두에서 최적화 기반 방법을 능가할 수 있음을 입증한다.

제안 방법

  • 매개변수 분산을 기반으로 한 피드백 메커니즘을 사용해 매개변수별로 운동량과 노이즈를 동적으로 조절하는 적응형 테라모미터 몽테카를로 샘플러인 ATMC를 제안한다.
  • SDE 기반 샘플링 과정의 안정성과 수렴성을 향상시키기 위해 수정된 2차 수치 적분 방법을 도입한다.
  • 배치 정규화를 SELU, 픽스업 초기화, 가중치 정규화로 대체하여 배치 통계량에 의존하지 않고도 훈련을 안정화하는 ResNet++을 설계한다.
  • 적응형 노이즈 주입을 갖춘 확률적 경사하강법을 사용해 연속 시간 SDE를 통해 모델 가중치의 사후 분포를 근사한다.
  • 다중 MCMC 샘플의 예측을 평균내어 사후 예측 분포를 적용함으로써 불확실성 추정을 향상시킨다.
  • 수렴성과 안정성을 향상시키기 위해 단계 크기 감소 스케줄링과 사이클 기반 훈련을 적용한다.

실험 결과

연구 질문

  • RQ1배치 정규화에 의존하지 않고도 MCMC 샘플링이 ImageNet과 같은 대규모 이미지 분류 벤치마크에 효과적으로 스케일링될 수 있는가?
  • RQ2ATMC에서의 적응형 노이즈 및 운동량 제어가 표준 SG-MCMC 방법에 비해 더 나은 수렴성과 강건성을 제공하는가?
  • RQ3ATMC의 사후 예측 추정치가 정확도와 테스트 로그우도 양면에서 표준 최적화 기반 방법을 능가할 수 있는가?
  • RQ4특히 낮은 신뢰도 예측 영역에서 ATMC의 불확실성 캘리브레이션은 최적화 기반 모델과 비교해 어떻게 되는가?

주요 결과

  • ResNet++를 사용할 때 ATMC는 강력한 최적화 기반 기준보다 CIFAR-10에서 95.5% 테스트 정확도와 0.505 테스트 로그우도를 달성한다.
  • ImageNet에서 ATMC의 단일 사후 샘플은 74.2%의 Top-1 정확도와 1.08 테스트 로그우도를 기록하며, 배치 정규화 없이도 최적화 기준을 초월한다.
  • ATMC의 사후 예측 추정치는 ImageNet에서 77.5%의 Top-1 정확도와 0.883 테스트 로그우도를 기록하여 배치 정규화를 사용한 최적화 기준(76.2% 정확도, 0.947 로그우도)을 초월한다.
  • ATMC는 과적합에 내재적으로 강건하여 조기 정지, 학습률 감소 또는 확률적 정규화를 필요로 하지 않는다.
  • ATMC의 불확실성 추정치는 특히 낮은 신뢰도 예측에서 최적화 기반 기준보다 훨씬 더 잘 캘리브레이션되어 있다.
  • 240 에포크 동안 훈련을 하였음에도 불구하고, ATMC의 사후 예측은 10배 더 오래 훈련한 배치 정규화 최적화 기준의 정확도(76.2%)와 동일한 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.