Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Dropout via Empirical Bayes

В. А. Харитонов, Dmitry Molchanov|arXiv (Cornell University)|2018. 11. 01.
Adversarial Robustness in Machine Learning참고 문헌 8인용 수 7
한 줄 요약

이 논문은 경험 베이즈를 사용하여 딥 네ural 네트워크에서 자동 관련성 결정(ARD)을 위한 변분 추론 방법을 제안하며, 변분 드롭아웃의 원칙적인 대안을 제공한다. 가중치 사전확률을 학습 가능한 정밀도 파라미터를 가진 가우시안 분포로 모델링함으로써, 부적절한 사전확률에 의존하지 않고도 희소성과 정확도를 유사하게 달성한다. 계층적 감마 초모수 사전확률은 희소성-정확도 트레이드오프를 더욱 향상시킨다.

ABSTRACT

We study the Automatic Relevance Determination procedure applied to deep neural networks. We show that ARD applied to Bayesian DNNs with Gaussian approximate posterior distributions leads to a variational bound similar to that of variational dropout, and in the case of a fixed dropout rate, objectives are exactly the same. Experimental results show that the two approaches yield comparable results in practice even when the dropout rates are trained. This leads to an alternative Bayesian interpretation of dropout and mitigates some of the theoretical issues that arise with the use of improper priors in the variational dropout model. Additionally, we explore the use of the hierarchical priors in ARD and show that it helps achieve higher sparsity for the same accuracy.

연구 동기 및 목표

  • 부적절한 사전확률과 특이한 사후확률로 인해 발생하는 변분 드롭아웃의 이론적 문제를 해결하기 위해.
  • 적절한 사전확률을 사용한 변분 추론을 통해 드롭아웃의 베이지안적 해석을 제공하기 위해.
  • 요소별로 분해된 가우시안 사후확률을 사용한 ARD를 통해 훈련 가능한, 레이어별 드롭아웃 비율을 가능하게 하기 위해.
  • 초모수에 대한 계층적 사전확률을 탐색하여 신경망 프루닝에서의 희소성-정확도 트레이드오프를 향상시키기 위해.
  • ARD 기반 드롭아웃이 희소 변분 드롭아웃의 성능을 비교하거나 초월하는지 경험적으로 검증하기 위해.

제안 방법

  • 가우시안 사전확률 p(w|τ) = ∏N(wi|0, τi⁻¹)에서 초모수 τ를 경험 베이즈를 통해 학습함으로써 자동 관련성 결정을 가능하게 한다.
  • 요소별로 분해된 가우시안 변분 사후확률 q(w|μ,σ) = ∏N(wi|μi,σi²)를 사용한 双중 스토하스틱 변분 추론(DDSI)을 적용하여 진짜 사후확률을 근사한다.
  • 고정된 드롭아웃 비율일 경우 변분 드롭아웃 목표와 일치하는 근거 하한값(ELBO)을 유도하고, τi* = (μi² + σi²)⁻¹를 통해 훈련 가능한 비율로 일반화한다.
  • 감마 초모수 사전확률 p(τi|a,b) = Gamma(τi|a,b)를 도입하고 MAP-II 추정을 사용해 a와 b를 학습함으로써 제어 가능한 희소성을 가능하게 한다.
  • 모서리 사전확률 p(wi)가 일반화된 스튜던트-t 분포가 되며, a,b→0일 때는 희소 변분 드롭아웃에서 사용하는 로그균일 사전확률이 한계 경우로 나타남을 보여준다.
  • 지역 재파rameterization 기울기 방법을 사용하여 μ와 σ에 대해 ELBO를 효율적으로 최적화한다.

실험 결과

연구 질문

  • RQ1적절한 사전확률을 사용한 ARD가 부적절한 사후확률을 피하는 이론적으로 타당한 변분 드롭아웃의 대안이 될 수 있는가?
  • RQ2드롭아웃 비율이 훈련 가능한 경우, ARD와 희소 변분 드롭아웃의 ELBO 목표치는 어떻게 비교되는가?
  • RQ3ARD 초모수에 대한 계층적 사전확률이 신경망 프루닝에서의 정확도-압축 트레이드오프를 향상시킬 수 있는가?
  • RQ4제안된 ARD 기반 드롭아웃 방법이 희소 변분 드롭아웃과 유사하거나 더 뛰어난 희소성과 정확도를 달성할 수 있는가?
  • RQ5계층적 ARD 모델 하에서의 모서리 사전확률과 희소 변분 드롭아웃에서 사용하는 로그균일 사전확률 간의 관계는 무엇인가?

주요 결과

  • 훈련 가능한 드롭아웃 비율을 가진 ARD 기반 목표함수(식 3)는 경험적으로 희소 변분 드롭아웃 목표함수(식 4)와 동일하며, 둘 다 비슷한 희소성과 정확도를 달성한다.
  • MNIST(LeNet-5)에서 ARD 드롭아웃은 0.76% 오차(±0.09)와 132개의 압축된 가중치를 기록했으며, 이는 희소 VD의 0.81% 오차(±0.04)와 136개의 압축된 가중치와 유사하다.
  • CIFAR-10(VGG 유사)에서 ARD 드롭아웃은 7.75% 오차(±0.28)와 34개의 압축된 가중치를 기록했으며, 희소 VD는 8.08% 오차(±0.27)와 38개의 압축된 가중치를 기록했다.
  • CIFAR-10에서 a=0.505, b=10⁻⁸인 감마 초모수 사전확률을 사용하면 7.46% 오차와 52개의 압축된 가중치를 기록했으며, 이는 유사한 정확도에서 더 높은 희소성을 보여준다.
  • 이 방법은 부적절한 사전확률과 특이한 사후확률을 피함으로써 이전 연구에서 지적된 변분 드롭아웃의 이론적 문제를 해결한다.
  • 계층적 ARD 모델 하에서의 모서리 사전확률은 a,b→0의 극한에서 희소 변분 드롭아웃에서 사용하는 로그균일 사전확률로 수렴하며, 두 접근법 간의 원칙적인 연결을 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.