Skip to main content
QUICK REVIEW

[논문 리뷰] VFunc: a Deep Generative Model for Functions

Philip Bachman, Riashat Islam|arXiv (Cornell University)|2018. 07. 11.
Reinforcement Learning in Robotics참고 문헌 32인용 수 7
한 줄 요약

VFunc는 함수와 잠재 변수 간의 공동 분포를 학습하는 딥 생성 모델을 제안하며, 변분 추론을 통해 함수 공간에서의 불확실성 추정을 가능하게 한다. 잠재 변수를 통해 함수를 샘플링함으로써 강화 학습에서 다양하고 고엔트로피 정책을 달성하고, 회귀 과제에서 더 나은 불확실성 정량화를 실현하며, 파rameter 공간 베이지안 방법보다 탐색과 다양성 측면에서 뛰어난 성능을 발휘한다.

ABSTRACT

We introduce a deep generative model for functions. Our model provides a joint distribution p(f, z) over functions f and latent variables z which lets us efficiently sample from the marginal p(f) and maximize a variational lower bound on the entropy H(f). We can thus maximize objectives of the form E_{f~p(f)}[R(f)] + c*H(f), where R(f) denotes, e.g., a data log-likelihood term or an expected reward. Such objectives encompass Bayesian deep learning in function space, rather than parameter space, and Bayesian deep RL with representations of uncertainty that offer benefits over bootstrapping and parameter noise. In this short paper we describe our model, situate it in the context of prior work, and present proof-of-concept experiments for regression and RL.

연구 동기 및 목표

  • 모델 파ram터가 아닌 함수 자체에 직접적인 불확실성을 포괄하는 생성 모델을 개발하는 것.
  • 하류 과제를 위한 함수의 주변 분포 $p(f)$ 에서 효율적인 샘플링을 가능하게 하는 것.
  • 강화 학습에서 탐색과 다양성을 증진하기 위해 엔트로피 $H(f)$ 에 대한 변분 하한을 최대화하는 것.
  • 딥 러닝에서의 불확실성 추정을 위한 가우시안 프로세스와 베이지안 신경망의 스케일러블 대안을 제공하는 것.
  • 증명 사례 실험을 통해 회귀 및 강화 학습에 적용 가능성을 입증하는 것.

제안 방법

  • 모델은 $p(f,z) = p(f|z)p(z)$ 와 같이 공동 분포를 정의하며, 여기서 $z$ 는 단순한 사전 분포 $p(z)$ 에서 샘플링된다.
  • 함수는 잠재 변수 $z$ 에 조건부로 설정된 신경망 $p(y|x,z)$ 를 통해 생성되며, 이는 입력 영역 전반에 걸쳐 함수 샘플링을 가능하게 한다.
  • 함수 공간에서의 엔트로피 $H(f)$ 에 대한 변분 하한을 최대화하기 위해 확률적 경량 변분 추론을 사용하여 다양성을 장려한다.
  • 회귀 과제의 경우 데이터 로그우도와 엔트로피 정규화 항이 포함되며, 강화 학습 과제의 경우 기대 보상과 정책 엔트로피 최대화 항이 포함된다.
  • 잠재 변수를 선형 보간하여 그리드월드 환경에서의 정책 이동과 같은 함수 행동의 부드러운 전이를 시각화한다.
  • 상태 방문 빈도와 함수 보간을 사용하여 정책 다양성과 불확실성 표현을 평가한다.

실험 결과

연구 질문

  • RQ1딥 생성 모델이 모델 파ram터가 아닌 함수에 대해 효과적으로 불확실성을 표현할 수 있는가?
  • RQ2잠재 조건부 샘플링이 회귀 및 강화 학습 과제에서 다채롭고 의미 있는 함수를 효과적으로 생성할 수 있는가?
  • RQ3함수 공간에서 엔트로피를 최대화하는 것이 강화 학습에서 탐색과 정책 다양성을 얼마나 향상시키는가?
  • RQ4잠재 공간 내 보간을 통해 낮은 데이터 영역에서의 의미 있는 불확실성 추정이 가능한가?
  • RQ5복잡한 환경인 더블슬릿 미로에서 잠재 변수는 어떻게 서로 다른 전략을 인코딩하는가?

주요 결과

  • 회귀 과제에서, 모델은 그림 1에 나타난 보간된 함수를 통해 학습 데이터가 적은 영역에서 불확실성이 증가하는 경향을 포착한다.
  • 더블슬릿 그리드월드에서, 잠재 변수 간의 보간은 부드러운 정책 전이를 생성하며, $\alpha$ 가 증가함에 따라 정책이 한 슬릿에서 다른 슬릿으로 이동한다.
  • 엔트로피 최대화를 통해 모델은 그리드월드에서 16개의 다채로운 정책을 생성하였으며, 각 정책은 목표지점에 도달하는 데 서로 다른 경로를 따르며, 상태 방문 빈도로 시각화되었다.
  • 모델은 네 객실 및 패친코 환경에서 서로 다른 전략을 효과적으로 학습하였으며, 각기 다른 $z$ 값이 서로 다른 주행 경로를 나타낸다.
  • 잠재 공간 보간을 통해 $z$ 가 정책 전이를 포함한 함수 행동의 의미 있는 연속적 변형을 인코딩하고 있음을 확인하였다. 특히 더블슬릿 미로에서 슬릿 간 정책 전이가 가능하다.
  • 부트스트랩핑이나 파ram터 노이즈에 의존하지 않으며, 효과적인 불확실성 정량화와 정책 다양성을 달성하였고, 탐색 능력에서 기존 표준 방법보다 뛰어난 성능을 발휘하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.