Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty Quantification for Sparse Deep Learning

Yuexi Wang, Veronika Ročková|arXiv (Cornell University)|2020. 02. 26.
Gaussian Processes and Bayesian Inference참고 문헌 54인용 수 9
한 줄 요약

이 논문은 비모수 회귀에서 희소 깊이 신경망을 위한 준모수적 Bernstein-von Mises 정리들을 수립하며, 선형 및 이차 기능에 대한 사후 분포가 渐近적으로 정규분포를 이룬다는 것을 보여준다. 이는 딥러닝에서 베이지안 불확실성 측정의 이론적 근거를 제공하며, 정규성 조건 하에서 희소 깊이 신경망의 신뢰구간이 타당한 빈도주의 커버리지를 가지는 것으로 나타난다.

ABSTRACT

Deep learning methods continue to have a decided impact on machine learning, both in theory and in practice. Statistical theoretical developments have been mostly concerned with approximability or rates of estimation when recovering infinite dimensional objects (curves or densities). Despite the impressive array of available theoretical results, the literature has been largely silent about uncertainty quantification for deep learning. This paper takes a step forward in this important direction by taking a Bayesian point of view. We study Gaussian approximability of certain aspects of posterior distributions of sparse deep ReLU architectures in non-parametric regression. Building on tools from Bayesian non-parametrics, we provide semi-parametric Bernstein-von Mises theorems for linear and quadratic functionals, which guarantee that implied Bayesian credible regions have valid frequentist coverage. Our results provide new theoretical justifications for (Bayesian) deep learning with ReLU activation functions, highlighting their inferential potential.

연구 동기 및 목표

  • 딥러닝에서의 불확실성 측정에 대한 이론적 근거 부족 문제를 해결하기 위해.
  • 희소 사전을 갖는 깊이 ReLU 신경망을 위한 준모수적 Bernstein-von Mises(BvM) 정리들을 수립하기 위해.
  • 회귀 함수의 기능에 대한 사후 신뢰영역이 타당한 빈도주의 커버리지를 가지는지 확인하기 위해.
  • 점진적 정규분포를 통해 지식 부족에 기반한 베이지안 불확실성과 고유한 빈도주의 추론을 연결하기 위해.

제안 방법

  • 희소 깊이 ReLU 신경망 사전을 포함한 베이지안 계층 모델을 사용하며, 스팘이크-앤프레드 사전을 통해 희소성을 구현한다.
  • 저차원 기능에 대한 사후 분포의 점진적 행동을 분석하기 위해 베이지안 비모수 통계 도구를 적용한다.
  • 모멘트 생성 함수의 수렴을 보여줌으로써 선형 기능에 대한 사후 분포의 점진적 정규성을 수립한다.
  • 이차 기능에 대해서는, 투영 및 근사 오차 한계를 활용하여 사후 분포가 진짜 기능 값 주위에 집중하는 조건을 유도한다.
  • 진짜 회귀 함수와 네트워크 아키텍처에 정규성 조건을 부과하며, 이는 희소성 및 깊이 제약을 포함한다.
  • 시에브 기반 접근법을 사용하여 분석을 점차 증가하는 유한 차원의 깊이 신경망 부분집합으로 제한함으로써 사후 집중을 보장한다.

실험 결과

연구 질문

  • RQ1비모수 회귀에서 희소 깊이 ReLU 신경망의 기능에 대한 베이지안 신뢰영역이 타당한 빈도주의 커버리지를 가지는가?
  • RQ2깊이 ReLU 신경망의 사후 분포가 진짜 회귀 함수 주위에 집중하는 조건은 무엇인가?
  • RQ3희소 깊이 네트워크 사전 하에서 회귀 함수의 선형 및 이차 기능이 점진적으로 정규분포를 띠는가?
  • RQ4고차원적이고 비정규적인 딥러닝 모델에서 준모수적 기능에 대해 Bernstein-von Mises 현상이 성립하는가?
  • RQ5희소 딥러닝 아키텍처에서 빈도주의 캘리브레이션을 위한 베이지안 불확실성의 이론적 근거를 확보할 수 있는가?

주요 결과

  • 희소 깊이 ReLU 신경망에서 선형 기능의 사후 분포는 점진적으로 정규분포를 띠며, 사후 분산은 역 피셔 정보로 수렴한다.
  • L^2-노름과 같은 이차 기능에 대해서는 사후 분포가 진짜 값 주위에 집중하고, 모멘트 생성 함수가 정규분포의 것으로 수렴한다.
  • 진짜 함수가 적절한 희소성 조건을 갖춘 시에브 내에 있을 경우, 선형 및 이차 기능에 대해 Bernstein-von Mises 현상이 성립한다.
  • 연구 대상 기능에 대해 사후 분포에서 유도된 신뢰영역은 점차적으로 타당한 빈도주의 커버리지를 달성한다.
  • 시에브 조건이 충족된다면, 네트워크 깊이, 너비, 희소성 구조에 대한 모델 불확실성에 대해 결과가 강건하다.
  • 이론적 근거는 이전 연구에서 확립된 희소 깊이 ReLU 신경망의 최적 사후 수렴 속도에 기반한다 (Polson & Rockova, 2018).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.