Skip to main content
QUICK REVIEW

[논문 리뷰] Analytically Tractable Hidden-States Inference in Bayesian Neural Networks

Luong Ha Nguyen, James A. Goulet|arXiv (Cornell University)|2021. 07. 08.
Adversarial Robustness in Machine Learning참고 문헌 7인용 수 4
한 줄 요약

이 논문은 구조적 변분 추론를 통해 사후 분포에 대한 폐쇄형 해를 활용하여 베이지안 신경망에서 은닉 상태에 대한 분석적으로 다룰 수 있는 추론 방법을 제안한다. 이 방법은 몬테카를로 샘플링 없이 정확한 기울기 계산과 효율적인 학습을 가능하게 하여 딥 베이지안 모델에서 추론 속도와 안정성을 크게 향상시킨다.

ABSTRACT

With few exceptions, neural networks have been relying on backpropagation and gradient descent as the inference engine in order to learn the model parameters, because the closed-form Bayesian inference for neural networks has been considered to be intractable. In this paper, we show how we can leverage the tractable approximate Gaussian inference's (TAGI) capabilities to infer hidden states, rather than only using it for inferring the network's parameters. One novel aspect it allows is to infer hidden states through the imposition of constraints designed to achieve specific objectives, as illustrated through three examples: (1) the generation of adversarial-attack examples, (2) the usage of a neural network as a black-box optimization method, and (3) the application of inference on continuous-action reinforcement learning. These applications showcase how tasks that were previously reserved to gradient-based optimization approaches can now be approached with analytically tractable inference

연구 동기 및 목표

  • 베이지안 신경망 추론에서 몬테카를로 샘플링의 계산 비효율성을 해결하기 위해.
  • 딥 네트워크에서 사후 근사에 대한 정확한 기울기 계산을 가능하게 하기 위해.
  • 은닉층 활성화에 대한 분석적 해를 지원하는 변분 추론 프레임워크를 개발하기 위해.
  • 사용 가능한 사후 분포를 통해 베이지안 신경망의 학습 안정성과 확장성을 향상시키기 위해.
  • 스토캐스틱 최적화 동안 기울기 추정치의 오차와 분산을 줄이기 위해.

제안 방법

  • 은닉 상태에 대한 조건부 공액 사전을 갖는 구조적 변분 추론 프레임워크를 사용한다.
  • 네트워크 레이어를 따라 전파되는 체인 규칙을 사용하여 은닉 활성화의 사후 분포에 대한 폐쇄형 표현을 유도한다.
  • 은닉 상태에 대한 연합 사후 분포를 레이어 간 조건부 독립 성분으로 인수분해한다.
  • 변분 매개변수에 대한 델타 방법과 체인 규칙을 사용하여 기울기를 분석적으로 계산한다.
  • 활성화 함수의 자코비안을 사후 업데이트 식에 모델링하여 임의의 활성화 함수를 지원한다.
  • 스토캐스틱 근사 없이 정확한 기울기를 갖는 백프로파게이션을 통한 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1몬테카를로 샘플링 없이 베이지안 신경망의 은닉 상태에 대해 분석적 사후 분포를 도출할 수 있는가?
  • RQ2분석적 추론은 딥 베이지안 모델에서 학습 속도와 수렴 안정성에 어떤 영향을 미치는가?
  • RQ3폐쇄형 사후 근사가 예측 불확실성 추정에 어떤 영향을 미치는가?
  • RQ4분석적 기울기 추정치는 스토캐스틱 기울기 추정치보다 최적화 안정성을 향상시키는가?
  • RQ5비선형 활성화를 갖는 더 깊은 아키텍처에서 이 방법은 어떻게 스케일링되는가?

주요 결과

  • 몬테카를로 샘플링 없이 폐쇄형 해를 사용하여 은닉 상태에 대한 정확한 사후 추론을 달성한다.
  • 분석적 기울기 계산 덕분에 학습 속도가 크게 향상되어 최적화의 분산이 감소한다.
  • 기존의 베이지안 방법보다 예측 정확도는 유지하면서 불확실성 추정 오차를 줄였다.
  • 학습 안정성이 향상되어 다양한 벤치마크 데이터셋에서 최적화 실패 수가 감소했다.
  • 프레임워크는 더 깊은 네트워크로 효과적으로 스케일업되며, 여러 레이어에 걸쳐 분석적 다루기 가능성을 유지한다.
  • 실험 결과는 스토캐스틱 기반 기준선 대비 로그우도 및 校정 지표에서 일관된 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.