[논문 리뷰] Compromise-free Bayesian neural networks
이 논문은 정확한 중첩 샘플링을 사용하여 전체 비정규 분포와 정확한 베이지안 증거(우도의 가장자리 확률)를 수치적으로 샘플링하는 절충안 없는 베이지안 신경망(BNNs)을 제안한다. 이는 모델 비교에 사용된다. 연구에서는 베이지안 증거와 검증 외 성능 간에 강한 상관관계를 발견하였으며, ReLU 네트워크가 항상 tanh 네트워크를 능가함을 보였다. 또한 다양한 아키텍처의 BNN을 앙상블하여 개별 모델을 초월한 예측 정확도 향상을 입증하였다.
We conduct a thorough analysis of the relationship between the out-of-sample performance and the Bayesian evidence (marginal likelihood) of Bayesian neural networks (BNNs), as well as looking at the performance of ensembles of BNNs, both using the Boston housing dataset. Using the state-of-the-art in nested sampling, we numerically sample the full (non-Gaussian and multimodal) network posterior and obtain numerical estimates of the Bayesian evidence, considering network models with up to 156 trainable parameters. The networks have between zero and four hidden layers, either $ anh$ or $ReLU$ activation functions, and with and without hierarchical priors. The ensembles of BNNs are obtained by determining the posterior distribution over networks, from the posterior samples of individual BNNs re-weighted by the associated Bayesian evidence values. There is good correlation between out-of-sample performance and evidence, as well as a remarkable symmetry between the evidence versus model size and out-of-sample performance versus model size planes. Networks with $ReLU$ activation functions have consistently higher evidences than those with $ anh$ functions, and this is reflected in their out-of-sample performance. Ensembling over architectures acts to further improve performance relative to the individual BNNs.
연구 동기 및 목표
- 베이지안 신경망에서 베이지안 증거와 검증 외 성능 간의 관계를 조사한다.
- 활성화 함수(ReLU 대비 tanh), 네트워크 깊이, 계층적 사전분포가 모델 증거와 예측 성능에 미치는 영향을 평가한다.
- 각 BNN의 베이지안 증거로 재가중하는 방법을 통해 개선된 일반화 성능을 얻는 앙상블 방법을 개발하고 테스트한다.
- 최신 수준의 중첩 샘플링을 사용하여 절충이 없는 정밀한 벤치마크를 제공한다.
- 기존의 백프로파게이션으로 학습된 신경망(TNNs)과 비교하여 절충안 없는 BNN의 성능을 평가한다.
제안 방법
- 연구는 최대 156개의 학습 가능한 파라미터를 가진 BNN의 전체 비정규 분포와 다모드 사후분포를 수치적으로 샘플링하기 위해 PolyChord 중첩 샘플링 알고리즘을 사용한다.
- 베이지안 증거(우도의 가장자리 확률)는 중첩 샘플링 출력에서 직접 계산되며, 정규분포나 라플라스 근사 없이 정확한 모델 비교가 가능하다.
- 다양한 아키텍처로 네트워크를 학습한다: 0~4개의 은닉층, ReLU 또는 tanh 활성화 함수, 다양한 계층적 사전분포 구조(입력, 계층, 또는 변수 초모수의 해상도).
- 개별 네트워크의 사후 샘플을 각각의 베이지안 증거 값으로 재가중하여 BNN 앙상블을 구성하고, 모델 평균 예측 분포를 형성한다.
- 개별 BNN과 그 앙상블의 성능은 10개의 랜덤 데이터 분할을 사용하여 보스턴 주택 데이터셋에서 평가되며, 주요 평가 지표로는 테스트 손실과 베이지안 증거를 사용한다.
- 기본 비교를 위해 정규화 없이 Adam 최적화로 학습된 기존 신경망(TNNs)을 사용하며, 동일한 아키텍처와 데이터 분할을 적용한다.
실험 결과
연구 질문
- RQ1베이지안 신경망에서 베이지안 증거와 검증 외 예측 성능 간에 강한 상관관계가 존재하는가?
- RQ2ReLU 활성화를 사용한 BNN이 tanh 활성화를 사용한 BNN보다 항상 더 높은 베이지안 증거와 더 나은 테스트 성능를 달성하는가?
- RQ3각 BNN의 베이지안 증거로 재가중한 앙상블은 개별 BNN에 비해 예측 성능에 어떤 영향을 미치는가?
- RQ4다양한 계층적 사전분포 구조(초모수의 해상도)는 모델 증거와 일반화에 어떤 영향을 미치는가?
- RQ5정규화 없이 표준 백프로파게이션으로 학습된 신경망(TNNs)과 비교했을 때 절충안 없는 BNN의 성능는 어떠한가?
주요 결과
- 모든 BNN 아키텍처에서 베이지안 증거와 검증 외 성능 간에 강한 양의 상관관계가 존재하여, 증거가 신뢰할 수 있는 모델 선택 기준임을 검증한다.
- ReLU 활성화를 사용한 BNN은 tanh 활성화를 사용한 BNN보다 유의미하게 높은 베이지안 증거와 낮은 테스트 손실을 기록하며, 최고의 ReLU 모델은 테스트 손실 0.1732를 달성하였다.
- 특히 계층 해상도 초모수를 가진 모델들을 아키텍처 간 앙상블하여 구성한 결과, 테스트 손실 0.1732를 기록하였으며, 개별 BNN 중 최고 성능(0.1791)을 초월하였다.
- 계층 해상도 초모수로 학습된 모든 모델의 앙상블이 가장 낮은 테스트 손실을 기록하여, 증거 기반 재가중 앙상블이 일반화 성능을 향상시킴을 입증하였다.
- 모든 변수 초모수를 가진 BNN은 해당하는 TNN에 비해 성능이 뛰어났으며, 대부분의 경우 tanh 활성화를 사용한 TNN이 ReLU TNN보다 성능이 뛰어나, 베이지안 정규화의 우수성을 강조하였다.
- 결합된 모델의 베이지안 증거 값은 개별 모델의 값 사이에 위치하며, 이는 모델 평균화에서 증거가 선형적으로 조합됨을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.