Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Inference with Tail-adaptive f-Divergence

Dilin Wang, Hao Liu|arXiv (Cornell University)|2018. 10. 29.
Adversarial Robustness in Machine Learning인용 수 20
한 줄 요약

이 논문은 변동 가능한 중요도 가중치의 尾尾(꼬리) 행동에 따라 볼록 함수 f를 동적으로 조정하는 尾尾 적응형 f-분산을 제안한다. 이는 유한한 모멘트와 안정적인 최적화를 보장하면서도 질량 커버링 성질을 유지한다. 이 방법은 베이지안 신경망과 딥 강화학습에서 표준 KL 및 α-분산 방법보다 뛰어난 성능을 보이며, 특히 다중모달성과 고차원 설정에서 두각을 나타낸다.

ABSTRACT

Variational inference with α-divergences has been widely used in modern probabilistic machine learning. Compared to Kullback-Leibler (KL) divergence, a major advantage of using α-divergences (with positive α values) is their mass-covering property. However, estimating and optimizing α-divergences require to use importance sampling, which could have extremely large or infinite variances due to heavy tails of importance weights. In this paper, we propose a new class of tail-adaptive f-divergences that adaptively change the convex function f with the tail of the importance weights, in a way that theoretically guarantees finite moments, while simultaneously achieving mass-covering properties. We test our methods on Bayesian neural networks, as well as deep reinforcement learning in which our method is applied to improve a recent soft actor-critic (SAC) algorithm. Our results show that our approach yields significant advantages compared with existing methods based on classical KL and α-divergences.

연구 동기 및 목표

  • 변분 추론에서 무거운 尾尾를 띤 중요도 가중치로 인한 α-분산 추정의 불안정성을 해결하기 위해.
  • 기울기 추정에서 유한한 분산을 보장하면서도 질량 커버링 성질을 유지하는 방법을 개발하기 위해.
  • 학습 중 밀도 비율의 尾尾 분포에 따라 분산 행동을 적응적으로 선택할 수 있도록 하기 위해.
  • 표준 KL 및 α-분산 목표 함수를 대체하여 베이지안 신경망과 딥 강화학습에서의 변분 추론 성능을 향상시키기 위해.
  • 실험적 가중치 분포에 기반해 f를 동적으로 수정하는 이론적으로 탄탄한 적응형 f-분산을 제공하기 위해.

제안 방법

  • 밀도 비율 w = p(x)/q(x)의 경험적 尾尾 분포에 기반해 볼록 함수 f를 적응적으로 조정하는 새로운 f-분산 클래스를 제안한다.
  • 중요도 가중치의 순위 기반 변환을 사용하여 고꼬리 영역에서 폭주를 방지하는 조각별 볼록 f-함수를 정의한다.
  • 재파라미터화 기반 기울기와 함께 스 tochastic 최적화를 적용하여 변분 근사의 엔드 투 엔드 학습을 가능하게 한다.
  • 각 기울기 단계에서 현재 w의 분포에 따라 f를 동적으로 업데이트하는 새로운 변분 추론 알고리즘(알고리즘 1)을 유도한다.
  • 정책 업데이트에서 KL 분산을 尾尾 적응형 f-분산으로 대체함으로써 소프트 액터-크리틱(SAC)에 이 방법을 적용한다.
  • qπ와 pQ 사이의 분산 최소화 문제로 재정의하기 위해 공동 분포 설정을 활용하여 강화학습에서 더 넓은 범위의 f-분산 사용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1중요도 가중치의 尾尾 행동에 따라 f-분산을 동적으로 적응시켜 유한한 모멘트와 안정적인 추정을 보장할 수 있는가?
  • RQ2尾尾 적응형 f-분산은 α-분산의 질량 커버링 성질을 유지하면서도 추정 안정성을 향상시키는가?
  • RQ3이 적응형 분산은 다중모달 사후분포를 가진 베이지안 신경망에서 변분 추론 성능을 향상시키는가?
  • RQ4특히 다중모달 결정 문제에서, 이 방법은 표본 효율성과 최종 성능을 향상시키는가?
  • RQ5복잡한 고차원 환경에서 이 적응형 f-분산은 고정된 α-분산 및 KL 기반 방법보다 성능가 어떻게 비교되는가?

주요 결과

  • 제안된 尾尾 적응형 f-분산은 중요도 가중치의 유한한 모멘트를 보장하여 기울기 추정에서 무한 분산의 위험을 제거한다.
  • 베이지안 신경망에서, 이 방법은 표준 KL 및 α-분산보다 진짜 사후분포의 다중 모드를 더 잘 복원한다.
  • MuJoCo 환경에서, 이 방법은 원본 SAC(α=0)와 테스트된 모든 α-분산 변형보다 최종 평균 보상에서 뛰어나며, Ant 및 Humanoid와 같은 복잡한 작업에서 특히 두각을 나타낸다.
  • 대부분의 환경에서 모든 기준보다 빠르게 학습을 진행하며, 더 높은 점진적 성능을 달성한다.
  • 성능 향상은 고차원이고 다중모달인 설정에서 가장 두드러지며, 이는 복잡한 사후 분포의 구조에서 이 방법의 효과성을 입증한다.
  • 실험 결과는 이 방법이 딥 강화학습에서 다중모달 손실 함수의 더 효율적인 최적화를 가능하게 함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.