Skip to main content
QUICK REVIEW

[논문 리뷰] A Probabilistic Framework for Nonlinearities in Stochastic Neural Networks

Qinliang Su, Xuejun Liao|arXiv (Cornell University)|2017. 09. 18.
Gaussian Processes and Bayesian Inference참고 문헌 22인용 수 12
한 줄 요약

이 논문은 확률적 프레임워크인 TruG를 제안한다. TruG는 이중으로 잘린 가우시안 분포를 사용하여 ReLU, 시그모이드, 탄젠트 비선형성을 통합함으로써, 확률적 신경망에서 비선형성과 모델 가중치를 동시에 학습할 수 있도록 한다. 이 프레임워크는 RBM, 시간적 RBM, TGGM 모델 전반에서 성능을 향상시켜 데이터 기반의 탄력적 비선형성 적응을 가능하게 한다.

ABSTRACT

We present a probabilistic framework for nonlinearities, based on doubly truncated Gaussian distributions. By setting the truncation points appropriately, we are able to generate various types of nonlinearities within a unified framework, including sigmoid, tanh and ReLU, the most commonly used nonlinearities in neural networks. The framework readily integrates into existing stochastic neural networks (with hidden units characterized as random variables), allowing one for the first time to learn the nonlinearities alongside model weights in these networks. Extensive experiments demonstrate the performance improvements brought about by the proposed framework when integrated with the restricted Boltzmann machine (RBM), temporal RBM and the truncated Gaussian graphical model (TGGM).

연구 동기 및 목표

  • 확률적 신경망을 위한 단일 프로브레틱 프레임워크 내에서 일반적으로 사용되는 비선형성(ReLU, 시그모이드, 탄젠트)을 통합하기 위해.
  • 비선형성을 네트워크 설계 시 고정하는 대신, 모델 가중치와 함께 종단 간(end-to-end) 학습이 가능하도록 하기 위해.
  • 볼츠만 기반 기계와 믿음 네트워크와 같은 확률적 신경망의 적용 범위를 넓혀, 데이터로부터 비선형성 파라미터를 학습할 수 있도록 하기 위해.
  • 생성 모델과 판별 모델 모두에서 결정론적 활성화 함수의 대안으로서 통합적이고 탄력적이며 확률적으로 기반을 둔 대안을 제공하기 위해.

제안 방법

  • 숨겨진 유닛을 잘린 가우시안 랜덤 변수로 모델링: $ p(h|z,\bm{\xi}) = \mathcal{N}_{[\xi_1,\xi_2]}(h|z,\sigma^2) $, 여기서 $ z $ 는 넷 입력이고 $ \bm{\xi} = (\xi_1, \xi_2) $ 는 학습 가능한 잘림 점이다.
  • 조건부 기대값 $ \mathbb{E}[h|z,\bm{\xi}] $ 를 사용하여, 적절한 $ \bm{\xi} $ 설정 하에서 ReLU, 시그모이드, 탄젠트를 근사하는 결정론적 활성화 함수를 유도한다.
  • 기존의 확률적 모델인 TruG-RBM, 시간적 TruG-RBM, TruG-TGGM에 TruG를 통합하기 위해, 표준 비선형성을 TruG 유닛으로 대체한다.
  • 최대 우도 기반으로 $ \bm{\xi} $ 를 학습함으로써 최적화 업데이트에 최소한의 변경으로 단위 수준 및 모델 수준의 비선형성 학습을 가능하게 한다.
  • 매개변수 추정을 위해 10회의 VB 순환을 수행하고, 적응적 학습률을 사용하는 RMSprop와 미니배치 학습을 활용한다.
  • 고정된 값과 학습 가능한 잘림 점을 평가하며, 개별(단위 수준) 및 공유(모델 수준) 파라미터 학습 전략을 포함한다.

실험 결과

연구 질문

  • RQ1이중으로 잘린 가우시안 분포를 사용하여 일반적으로 사용되는 비선형성(ReLU, 시그모이드, 탄젠트)을 통합할 수 있는가?
  • RQ2RBM 및 TGGM과 같은 확률적 신경망에서 비선형성과 모델 가중치를 함께 학습시킬 수 있는가?
  • RQ3비선형성 파라미터(잘림 점)를 학습시키는 것이 생성 모델과 판별 모델 모두에서 고정된 비선형성보다 성능을 향상시키는가?
  • RQ4다양한 데이터셋에서 다양한 잘림 점 설정(예: [0,1], [-1,1], [0,∞)) 이 모델 성능에 미치는 영향은 어떠한가?
  • RQ5기존의 확률적 모델에 최소한의 아키텍처나 알고리즘 변경으로 TruG 프레임워크를 원활하게 통합할 수 있는가?

주요 결과

  • TruG 프레임워크는 잘림 점 $ \xi_1 $ 와 $ \xi_2 $ 를 조절하여 ReLU, 시그모이드, 탄젠트를 이중으로 잘린 가우시안의 특수 케이스로 성공적으로 통합한다.
  • 시간적 RBM에서 TruG-RBM는 학습된 잘림 점을 사용하여 산책 시 7.3% 오차, 달리기 시 5.9% 오차를 기록하여 원본 TRBM(9.6% 및 6.8%)과 c-Learn(6.7% 및 5.5%)을 모두 능가한다.
  • 보스턴 주택 데이터셋에서 TruG-TGGM의 경우, 학습된 잘림 점(s-Learn)을 사용한 모델은 3.401 ± 0.375 RMSE를 기록하여 ReLU 기반 MLP(3.228 ± 0.195) 및 다른 TruG 변종을 모두 초월한다.
  • K8nm 데이터셋에서 TruG-TGGM는 학습된 잘림 점(s-Learn)을 사용하여 0.073 ± 0.002 RMSE를 기록하여 ReLU 기반 MLP(0.091 ± 0.002)보다 유의미하게 뛰어나다.
  • 개별 잘림 점 학습(s-Learn) 방식은 대부분의 데이터셋에서 공통 학습(c-Learn) 방식을 능가했으며, 단백질 구조 데이터셋에서도 4.206 ± 0.071 vs. 4.209 ± 0.073 RMSE로 우수한 성능을 기록했다.
  • 이 프레임워크는 동일한 모델 아키텍처 내에서 비선형성을 쉽게 교환할 수 있도록 하여, 아키텍처 변경 없이 ReLU를 시그모이드나 탄젠트로 간편하게 교체할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.