Skip to main content
QUICK REVIEW

[논문 리뷰] A Bayesian Perspective on Training Speed and Model Selection

Clare Lyle, Lisa Schut|arXiv (Cornell University)|2020. 10. 27.
Gaussian Processes and Bayesian Inference참고 문헌 43인용 수 9
한 줄 요약

이 논문은 선형 모델과 딥 네URAL 네트워크에서 학습 속도와 근사 우도 추정 간의 베이지안 프레임워크를 제안한다. 순차적으로 처리된 데이터에 대한 학습 로그우도의 합(SOTL)이 근사 우도를 근사함을 보여줌으로써, 빠르게 학습되는 모델이 모델 선택 및 선형 모델 조합 모두에서 유리함을 드러내며, 딥 러닝에서 SGD가 잘 일반화되는 이유에 대한 새로운 설명을 제공한다.

ABSTRACT

We take a Bayesian perspective to illustrate a connection between training speed and the marginal likelihood in linear models. This provides two major insights: first, that a measure of a model's training speed can be used to estimate its marginal likelihood. Second, that this measure, under certain conditions, predicts the relative weighting of models in linear model combinations trained to minimize a regression loss. We verify our results in model selection tasks for linear models and for the infinite-width limit of deep neural networks. We further provide encouraging empirical evidence that the intuition developed in these settings also holds for deep neural networks trained with stochastic gradient descent. Our results suggest a promising new direction towards explaining why neural networks trained with stochastic gradient descent are biased towards functions that generalize well.

연구 동기 및 목표

  • 학습 속도와 베이지안 모델 선택에서의 근사 우도 간 이론적 연결을 수립하는 것.
  • 표준 SGD 학습 절차를 모방하는 계산적으로 효율적인 근사 우도 추정기 개발.
  • 순차적으로 처리된 데이터에 대한 예측 로그우도의 합으로 측정되는 학습 속도가 선형 조합에서의 모델 성능과 가중치 예측에 기여하는지 조사하는 것.
  • 선형 모델에서의 통찰을 무한한 너비 근처의 딥 네URAL 네트워크로 확장하고, 이를 실증적으로 검증하는 것.
  • 동일한 원칙이 훈련된 DNN 내부의 하위망구조에도 적용되는지 탐색하여, 네트워크 내 일반화 편향의 메커니즘을 제안하는 것.

제안 방법

  • 순차적 베이지안 업데이트에서 이전 데이터 포인트를 조건으로 한 예측 로그우도의 합에 기반한 근사 우도 추정기의 가족을 제안한다.
  • 선형 모델과 무한한 너비의 DNN에서 경사 하강법이 정확한 사후 표본을 생성함을 활용하여, SOTL과 근사 우도 추정 간 정확한 대응 관계를 확립한다.
  • 반복적 베이지안 업데이트를 통해 데이터 포인트를 순차적으로 처리하면서 로그우도의 합을 계산하여 SOTL 추정기를 구성한다.
  • 정확한 근사 우도와 비교하여 선형 모델과 무한한 너비의 DNN에서의 모델 선택 과제에 SOTL 추정기를 적용한다.
  • SGD로 훈련된 선형 앙상블에서 SOTL을 테스트 정확도와 모델 가중치의 대체 지표로 실증적으로 평가한다.
  • 최종 은닉층 활성화를 개별 모델로 간주하여 DNN 내 하위망구조로 분석을 확장하고, 최종 선형층에서의 최종 가중치를 평가한다.

실험 결과

연구 질문

  • RQ1순차적으로 처리된 데이터에 대한 예측 로그우도의 합으로 측정되는 학습 속도가, 베이지안 모델 선택에서 근사 우도의 대체 지표로 기능할 수 있는가?
  • RQ2SOTL 추정기가 기울기 하강법으로 훈련된 선형 모델 조합에서 모델의 상대적 가중치 예측에 성공하는가?
  • RQ3SGD로 훈련된 딥 네URAL 네트워크에서 SOTL이 일반화 성능과 어느 정도 상관관계를 가지는가?
  • RQ4훈련된 DNN 내부에선, 예를 들어 하위망구조의 차별적 가중치 부여와 같은 메커니즘이 선형 모델에서 관찰된 빠른 학습 모델을 선호하는 경향을 반영하는가?
  • RQ5SOTL이 유한한 너비 네트워크에서도 SGD가 잘 일반화되는 모델을 선호하는 이유에 대해 원칙적인 설명을 제공할 수 있는가?

주요 결과

  • 선형 모델과 무한한 너비의 DNN에서 순차적으로 처리된 데이터에 대한 학습 로그우도의 합(SOTL)이 근사 우도를 잘 근사한다.
  • SOTL은 테스트 세트 성능과 강하게 상관관계가 있다: 평균 테스트 교차엔트로피가 낮은 모델일수록 SOTL 값이 높았다.
  • 기울기 하강법으로 훈련된 선형 모델 조합에서 SOTL 값이 높은 모델은 유의미하게 더 큰 최종 가중치를 할당받았다.
  • 실증 결과는 SOTL이 SGD로 훈련된 DNN에서 최종 테스트 정확도를 잘 예측함을 보여주었으며, 다양한 아키텍처에서 강한 정적 상관관계가 관찰되었다.
  • DNN 내부에서 개별적으로 더 잘 수행하는 하위망구조(최전단 활성화)는 SOTL 값이 높고, 최종 선형층에서 더 큰 가중치를 할당받아, 빠르게 학습되는 구성 요소를 선호하는 편향이 있음을 시사한다.
  • SOTL 추정기는 정확한 계산이 가능한 환경에서 근사 우도를 정밀하게 따라가며, 비용이 많이 드는 변분 추론의 계산적으로 효율적인 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.