[논문 리뷰] Two Methods For Wild Variational Inference
이 논문은 추론 네트워크에서 해석 가능한 밀도 함수가 필요하지 않도록 하는 두 가지 월드 변분 추론 방법을 제안한다. 이를 통해 일반적인 확률적 신경 샘플러의 엔드 투 엔드 훈련이 가능해진다. 스틸 산란도 및 암시적 SVGD를 활용하여, 스트로스틱 그래디언트 랑주비안 동역학(SGLD)에 대한 최적의 스텝 크기를 자동으로 학습할 수 있으며, 이는 가우시안 믹스처 및 베이지안 로지스틱 회귀 작업에서 수작업으로 설계된 스케줄링보다 뛰어난 성능을 보인다.
Variational inference provides a powerful tool for approximate probabilistic in- ference on complex, structured models. Typical variational inference methods, however, require to use inference networks with computationally tractable proba- bility density functions. This largely limits the design and implementation of vari- ational inference methods. We consider wild variational inference methods that do not require tractable density functions on the inference networks, and hence can be applied in more challenging cases. As an example of application, we treat stochastic gradient Langevin dynamics (SGLD) as an inference network, and use our methods to automatically adjust the step sizes of SGLD, yielding significant improvement over the hand-designed step size schemes
연구 동기 및 목표
- 추론 네트워크에서 해석 가능한 밀도 함수가 요구되는 변분 추론의 한계를 해결함으로써 모델의 유연성을 제한하는 문제를 해결한다.
- 해석 불가능한 밀도를 가진 일반적인 추론 네트워크의 훈련을 가능하게 하여 샘플링 절차를 자동으로 학습할 수 있도록 한다.
- 수작업 조정 없이도 스트로스틱 그래디언트 랑주비안 동역학(SGLD)에 대한 최적의 스텝 크기 스케줄을 적응적으로 학습할 수 있는 방법을 개발한다.
- 복잡한 베이지안 모델에서 수작업으로 설계된 학습률 스케줄링보다 월드 변분 추론이 뛰어난 성능을 보임을 입증한다.
제안 방법
- 제안된 분포와 추론 네트워크 출력 간의 산란도를 최소화하기 위해 커널 기반 스틸 산란도(KSD)를 사용하며, 제안 분포의 밀도 평가가 필요 없이도 된다.
- KL 산란도를 감소시키는 방향으로 추론 네트워크 파라미터를 반복적으로 조정하기 위해 암시적 스틸 변분 그래디언트 강하(amortized SVGD)를 활용한다.
- 소형 배치 환경에서 KSD를 추정하기 위해 U통계량을 적용하여 대규모 데이터셋에서도 확장 가능한 최적화를 가능하게 한다.
- SGLD 업데이트를 학습 가능한 스텝 크기를 가진 미분 가능한 신경망으로 간주하고, 시간에 따라 역전파를 통해 훈련한다.
- SGLD를 T층으로 구성된 깊이 있는 생성 모델로 간주하며, 각 층은 하나의 SGLD 단계에 해당한다.
- 신경망의 은닉 상태에 따라 매개변수화된 스텝 크기 스케줄을 정의하고, 기울기 기반 최적화를 통해 훈련한다.
실험 결과
연구 질문
- RQ1해석 불가능한 밀도 함수를 가진 추론 네트워크로 변분 추론을 확장할 수 있는가? 이는 더 유연하고 적응적인 샘플링을 가능하게 하는가?
- RQ2커널 기반 스틸 산란도를 사용하여 제안 분포의 명시적 밀도 평가 없이도 신경 샘플러를 훈련시킬 수 있는가?
- RQ3암시적 SVGD는 복잡한 사후 분포에서 SGLD에 대한 최적의 스텝 크기 스케줄을 효과적으로 학습할 수 있는가?
- RQ4수동으로 설계된 스케줄링과 비교해 볼 때, SGLD 스텝 크기의 엔드 투 엔드 학습 방식은 수렴성과 정확성 측면에서 어떻게 성능을 내는가?
- RQ5학습된 스텝 크기 정책은 새로운 데이터셋에 일반화되어 더 적은 반복 수로도 높은 성능을 유지할 수 있는가?
주요 결과
- 암시적 SVGD와 KSD 최소화 방법은 일련의 1차원 가우시안 믹스처를 근사할 때, 일정한 및 거듭제곱 감소 스케줄보다 유의미하게 높은 사후 커버리지 성능을 보였으며, 단지 20회의 SGLD 단계만으로도 성능을 확보했다.
- Covertype 데이터셋에서 두 제안 방법 모두 모든 수작업 학습률 스케줄보다 높은 테스트 정확도와 가능도를 달성했으며, 수렴된 SGLD 및 SVGD에 가까운 성능을 더 적은 반복 수로 달성했다.
- KSD 기반 훈련은 초기 성능 향상이 급격히 이루어지다가 포화 상태에 이르렀고, 반면 암시적 SVGD는 초기 진전이 느렸지만 후반기 반복에서 급격한 성능 향상을 보였다.
- 학습된 스텝 크기 정책은 새로운 테스트 소형 데이터셋으로도 잘 일반화되었으며, 다양한 데이터 분할 간의 강인성과 이식 가능성을 입증했다.
- T=100층의 경우, 제안된 방법들은 정확도와 가능도 측면에서 거의 최적의 성능을 달성했으며, SGLD 업데이트의 시간적 동역학을 효과적으로 학습했다는 것을 시사한다.
- 결과적으로, 월드 변분 추론이 복잡한 베이지안 모델을 위한 효율적인 샘플링 절차를 자동으로, 적응적으로, 확장 가능하게 학습시킬 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.