Skip to main content
QUICK REVIEW

[논문 리뷰] Consistent Sparse Deep Learning: Theory and Computation

Yan Sun, Qifan Song|arXiv (Cornell University)|2021. 02. 25.
Gaussian Processes and Bayesian Inference참고 문헌 85인용 수 6
한 줄 요약

이 논문은 베이지안 프레임워크 하에서 희소 딥 네ural 네트워크(DNNs)를 학습하기 위한 편의적 유사 방법을 제안하며, 사후 일致성, 변수 선택 일치성, 최적의 일반화 경계를 보장한다. 이는 혼합 가우시안 사전분포와 라플라스 근사 기반의 주변 사후 포함 확률을 통해 달성되며, 확률적 경량 하강법을 사용한 효율적이고 확장 가능한 학습을 가능하게 하면서도 DNN의 연결 수가 최대 $O(n/\log n)$일 경우 이론적 보장을 유지한다.

ABSTRACT

Deep learning has been the engine powering many successes of data science. However, the deep neural network (DNN), as the basic model of deep learning, is often excessively over-parameterized, causing many difficulties in training, prediction and interpretation. We propose a frequentist-like method for learning sparse DNNs and justify its consistency under the Bayesian framework: the proposed method could learn a sparse DNN with at most $O(n/\log(n))$ connections and nice theoretical guarantees such as posterior consistency, variable selection consistency and asymptotically optimal generalization bounds. In particular, we establish posterior consistency for the sparse DNN with a mixture Gaussian prior, show that the structure of the sparse DNN can be consistently determined using a Laplace approximation-based marginal posterior inclusion probability approach, and use Bayesian evidence to elicit sparse DNNs learned by an optimization method such as stochastic gradient descent in multiple runs with different initializations. The proposed method is computationally more efficient than standard Bayesian methods for large-scale sparse DNNs. The numerical results indicate that the proposed method can perform very well for large-scale network compression and high-dimensional nonlinear variable selection, both advancing interpretable machine learning.

연구 동기 및 목표

  • 딥 네ural 네트워크(DNNs)의 과도한 파rameter화가 학습, 일반화 및 해석 가능성에 악영향을 미치는 문제를 해결하기 위해.
  • 베이지안 프레임워크 하에서 이론적 일치 보장을 갖는 희소 DNN 학습 방법을 개발하기 위해.
  • 확률적 경량 하강법과 같은 최적화 기반 방법을 활용해 대규모 희소 DNN의 효율적이고 확장 가능한 학습을 가능하게 하기 위해.
  • 유한한 가중치와 연결 수를 갖는 희소 DNN에 대해 사후 일치성과 변수 선택 일치성을 확립하기 위해.
  • 약간의 정규성 조건 하에서 베이지안 프레임워크 하에서 확률적 경량 하강법으로 훈련된 희소 DNN에 대해 점점 최적의 일반화 경계를 제공하기 위해.

제안 방법

  • DNN 가중치에 혼합 가우시안 사전분포를 사용하여 희소성 유도 및 베이지안 추론 가능하게 한다.
  • 구조 선택을 위해 라플라스 근사를 적용하여 주변 사후 포함 확률을 계산한다.
  • 다양한 초기화로 수행된 다수의 SGD 훈련 런에서의 베이지안 증거를 활용해 희소 DNN를 선택한다.
  • 혼합 가우시안 사전분포 하에서 희소 DNN의 사후 일치성을 확립하여 표본 크기가 증가함에 따라 진짜 모형으로 수렴함을 보장한다.
  • MCMC보다 계산 효율성을 높이기 위해 최적화 기반 훈련(예: SGD)과 베이지안 모델 선택을 융합한다.
  • 층별 활성화와 가중치 편향에 대한 재귀 부등식을 이용해 네트워크 출력과 모델 차이에 대한 이론적 경계를 유도한다.

실험 결과

연구 질문

  • RQ1$O(n/\log n)$ 연결 수를 갖는 희소 DNN이 사후 일치성과 최적의 일반화 경계를 달성할 수 있는가?
  • RQ2베이지안 사후 포함 확률을 사용해 희소 DNN의 구조가 일관되게 복원 가능한가?
  • RQ3확률적 경량 하강법과 같은 최적화 기반 방법을 베이지안 모델 선택과 융합해 일관된 희소 DNN 학습을 달성할 수 있는가?
  • RQ4제안된 방법은 고차원 비선형 특성 선택에서 변수 선택 일치성을 어떻게 보장하는가?
  • RQ5베이지안 프레임워크 하에서 확률적 경량 하강법으로 훈련된 희소 DNN에 대해 어떤 이론적 보장을 확립할 수 있는가?

주요 결과

  • 제안된 방법은 혼합 가우시안 사전분포 하에서 희소 DNN의 사후 일치성을 달성하여 표본 크기가 증가함에 따라 진짜 모형으로 수렴함을 보장한다.
  • 라플라스 근사 기반 주변 사후 포함 확률을 통한 변수 선택 일치성이 확립되어 관련 연결의 신뢰성 있는 식별이 가능하다.
  • 이론적 분석을 통해 $O(n/\log n)$ 이하의 연결 수를 갖는 희소 DNN가 원하는 정확도로 진짜 맵핑을 근사할 수 있음을 보여준다.
  • SGD와 베이지안 증거를 융합함으로써 대규모 희소 DNN의 효율적 학습이 가능해지며, MCMC의 계산 부담을 피할 수 있다.
  • 수치 결과는 네트워크 압축과 고차원 비선형 변수 선택에서 뛰어난 성능을 확인하여 이해 가능한 기계학습의 발전을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.