[논문 리뷰] Fast Adaptive Weight Noise
이 논문은 샘플링 없이 분산 전파를 활용하여 가중치 불확실성 하에서 근사된 주변 가능도 및 예측 분포를 계산함으로써, 피드포워드 신경망에서 변분 베이지안 추론을 위한 계산적으로 효율적인 방법인 Fast Adaptive Weight Noise (FAWN)를 제안한다. 이는 소규모 및 대규모 데이터셋에서 경쟁적인 회귀 성능을 달성하며, 기존의 방법들인 가우시안 프로세스와 확률적 백프로파게이션을 능가한다.
Marginalising out uncertain quantities within the internal representations or parameters of neural networks is of central importance for a wide range of learning techniques, such as empirical, variational or full Bayesian methods. We set out to generalise fast dropout (Wang & Manning, 2013) to cover a wider variety of noise processes in neural networks. This leads to an efficient calculation of the marginal likelihood and predictive distribution which evades sampling and the consequential increase in training time due to highly variant gradient estimates. This allows us to approximate variational Bayes for the parameters of feed-forward neural networks. Inspired by the minimum description length principle, we also propose and experimentally verify the direct optimisation of the regularised predictive distribution. The methods yield results competitive with previous neural network based approaches and Gaussian processes on a wide range of regression tasks.
연구 동기 및 목표
- 기존의 가우시안 프로세스나 랜덤 포레스트와 같은 방법이 선호되는 소규모 데이터 회귀 작업에 베이지안 신경망을 적용하는 데 도전하는 것.
- 깊은 신경망에서 샘플링 기반의 베이지안 추론의 계산 부담을 줄이기 위해 주변 가능도와 예측 분포를 결정론적으로 근사화할 수 있도록 하는 것.
- 최소 기술 길이 원리에 기반하여 예측 분포를 직접 최적화하는 새로운 정규화된 변분 추론 방법(FAWN-ROPD)을 개발하는 것.
- 빠른 드롭아웃을 일반적인 노이즈 프로세스와 상관관계가 있는 출력 유닛을 처리할 수 있도록 확장하여, 불확실성 추정의 효율성과 정확도를 향상시키는 것.
제안 방법
- 가중치 불확실성 하에서 네트워크 출력의 평균과 분산을 분산 전파를 통해 계산하여, 학습 중에 확률적 샘플링을 피하는 것.
- 빠른 드롭아웃을 일반적인 노이즈 분포(Gaussian 및 Bernoulli)에 대해 일반화하여, 파라미터의 효율적 마진화를 가능하게 하는 것.
- 최소 기술 길이 원리에 영감을 얻어, 음의 로그가능도에 정규화 항을 더한 새로운 정규화된 목표 함수(FAWN-ROPD)를 도입하는 것.
- 가중치 분포를 대각 행렬의 가우시안 또는 베르누이 분포로 모델링하고, 분산 전파 규칙을 통해 역전파를 통해 파라미터를 최적화하는 것.
- ReLU 활성화 함수를 사용하는 피드포워드 신경망에 적용하며, 128개 샘플의 미니배치 기반 경사 하강법을 사용하여 Adam 최적화를 수행하는 것.
- 출력 유닛 간의 상관관계를 고려하기 위해 다중 출력 설정으로 분산 전파를 확장하여, 공동 불확실성 모델링을 위한 Co-FAWN를 제공하는 것.
실험 결과
연구 질문
- RQ1샘플링 없이도 분산 전파를 사용하여 베이지안 신경망에서 주변 가능도 및 예측 분포를 효율적으로 근사할 수 있는가?
- RQ2제안된 FAWN-ROPD 방법은 소규모 데이터 회귀 작업에서 표준 변분 추론 및 기타 베이지안 딥러닝 접근법과 비교해 예측 성능에서 어떻게 성과를 내는가?
- RQ3FAWN는 베르누이 드롭아웃을 초월하여 다른 노이즈 프로세스와 상관관계가 있는 출력 유닛으로 일반화될 수 있는가?
- RQ4최소 기술 길이 원리에 기반한 정규화된 예측 분포의 직접 최적화는 표준 변분 추론보다 더 나은 일반화 성능을 낼 수 있는가?
- RQ5다양한 크기의 데이터셋을 가진 다양한 회귀 벤치마크에서 FAWN는 가우시안 프로세스 및 기타 최신 기술 대비 어떻게 성능을 내는가?
주요 결과
- BOSTON, CONCRETE, YACHT 데이터셋에서 FAWN-ROPD는 모든 방법 중 최고의 성능을 보였으며, 음의 로그가능도는 각각 2.559 ± 0.161, 3.107 ± 0.134, 0.336 ± 0.271을 기록했다.
- NAVAL 데이터셋에서는 FAWN-ROPD가 음의 로그가능도 -6.837 ± 0.131을 기록하여, 가우시안 프로세스 및 확률적 백프로파게이션을 포함한 모든 다른 방법들을 능가했다.
- KIN8NM 데이터셋에서는 FAWN-ROPD가 음의 로그가능도 -1.211 ± 0.032를 기록하여, FAWN-VI(-1.006 ± 0.027) 및 PBP(-0.964 ± 0.007)보다 유의미하게 뛰어났다.
- 다중 출력 회귀를 위한 JURA 데이터셋에서 Co-FAWN는 FAWN-ROPD의 음의 로그가능도 11.1407 ± N/A에서 8.6396 ± N/A로 감소시켜, 상관관계가 있는 출력에서의 성능 향상을 입증했다.
- 대규모 Year 데이터셋(515,345개 샘플)에서는 FAWN-ROPD가 음의 로그가능도 3.472 ± N/A를 기록하여, FAWN-VI(3.807 ± N/A)를 능가했으며, 대규모 데이터셋에 대한 확장성도 입증했다.
- 모든 테스트된 회귀 작업(로봇공학, 계산 생물학, 예측 유지보수 포함)에서 경쟁적인 성능를 달성했으며, 별도의 검증 세트나 광범위한 하이퍼파rameter 튜닝이 필요로 하지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.