Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Policy Optimization for Model Uncertainty

Gilwoo Lee, Brian Hou|arXiv (Cornell University)|2018. 10. 01.
Reinforcement Learning in Robotics참고 문헌 24인용 수 4
한 줄 요약

이 논문은 연속적 베이지-적응형 마르코프 결정 과정(BAMDP)에 대해 직접적으로 잠재 모수에 대한 믿음 분포를 고려하여 정책을 학습하는 배치 정책 최적화 방법인 베이지안 정책 최적화(BPO)를 제안한다. 신경망 내에서 상태와 믿음 인코딩을 분리하고, 오프라인 훈련 중 블랙박스 베이즈 필터를 사용함으로써 BPO는 비믿음 기반의 강화학습 방법을 능가하고, 모델 불확실성이 존재하는 연속 제어 벤치마크에서 최신의 POMDP 솔버와 동등한 성능을 달성한다.

ABSTRACT

Addressing uncertainty is critical for autonomous systems to robustly adapt to the real world. We formulate the problem of model uncertainty as a continuous Bayes-Adaptive Markov Decision Process (BAMDP), where an agent maintains a posterior distribution over latent model parameters given a history of observations and maximizes its expected long-term reward with respect to this belief distribution. Our algorithm, Bayesian Policy Optimization, builds on recent policy optimization algorithms to learn a universal policy that navigates the exploration-exploitation trade-off to maximize the Bayesian value function. To address challenges from discretizing the continuous latent parameter space, we propose a new policy network architecture that encodes the belief distribution independently from the observable state. Our method significantly outperforms algorithms that address model uncertainty without explicitly reasoning about belief distributions and is competitive with state-of-the-art Partially Observable Markov Decision Process solvers.

연구 동기 및 목표

  • 시스템의 동역학이나 보상이 부분적으로 알려져 있지 않은 연속 제어 환경에서의 모델 불확실성 문제를 해결하기 위해.
  • 잠재 매개수에 대한 믿음 분포를 명시적으로 고려하는, 스케일링 가능한 종단 간 딥 강화학습 방법을 개발하기 위해.
  • 연속적 BAMDP에서 믿음 공간의 지수적 증가를 효율적인 믿음 상태 표현과 정책 학습을 통해 극복하기 위해.
  • 직접 믿음 상태 위에서 정책 최적화를 수행할 경우, 몬테카를로 트리 검색이나 점 기반 가치 함수 근사와 비교해 더 스케일링 가능한 성능을 달성할 수 있는지 입증하기 위해.

제안 방법

  • BPO는 에이전트가 잠재 모수에 대한 사후 믿음을 블랙박스 베이즈 필터를 사용해 유지하는 연속적 BAMDP로 문제를 설정한다.
  • 정책 네트워크는 상태와 믿음의 조합 입력을 취하며, 상태와 믿음의 표현을 분리하고 차원을 줄이기 위해 별도의 인코더를 사용한다.
  • 오프라인 훈련 중 BPO는 다수의 샘플링된 잠재 모델을 통해 정책을 시뮬레이션하고, 행동이나 관측에 따라 분기하지 않고 시뮬레이션된 궤적을 따라 믿음을 업데이트한다.
  • 이 방법은 배치 정책 최적화(예: TRPO)를 활용하여 베이지안 가치 함수를 직접 최적화함으로써 믿음 불확실성 하에서 기대 장기 보상 최대화를 추구한다.
  • 믿음 표현은 연속적인 잠재 매개수 공간의 이산화를 통해 구성되며, 믿음 벡터는 상태 임bedding과 별도로 인코딩된다.
  • 이 방법은 정책 최적화 알고리즘의 선택에 관계없이 적용 가능하므로, PPO와 같은 현대적 방법과의 통합이 가능하다.

실험 결과

연구 질문

  • RQ1연속적 BAMDP에서 명시적 가치 함수 근사 없이 종단 간 신경망 정책 네트워크를 통해 베이지안 가치 함수를 직접 최적화할 수 있는가?
  • RQ2모델 불확실성이 존재할 때 믿음 인식 정책 학습은 모델 매개수의 최대우도추정(MLE)을 사용하는 방법과 비교해 어떻게 성능을 내는가?
  • RQ3독립적인 상태 및 믿음 인코딩은 고차원 믿음 공간에서의 차원의 저주 문제를 어느 정도 완화할 수 있는가?
  • RQ4BPO는 잠재 매개수 불확실성이 존재하는 연속 제어 벤치마크에서 최신 기술의 POMDP 솔버와 비교해 경쟁 가능한 성능을 달성하는가?

주요 결과

  • BPO는 HalfCheetah 환경에서 EPOpt와 UP-MLE를 크게 능가하여 다양한 MDP에서 더 높은 평균 수익을 달성한다.
  • Ant 환경에서는 BPO가 UP-MLE보다 믿음 엔트로피를 더 빨리 감소시켜 믿음 분포가 단일 모드 상태로 수렴하는 데 더 빠른 수렴 속도를 보인다.
  • BPO는 가치 함수 근사나 트리 탐색을 사용하지 않음에도 불구하고, 연속 제어 벤치마크에서 최신 기술의 POMDP 솔버와 경쟁 가능한 성능을 달성한다.
  • 잠재 매개수 공간의 이산화 수준이 증가함에 따라 BPO는 잘 스케일링되지만, 최적의 이산화 수준을 초과하면 성능이 저하됨을 보여, 적응형 해상도 필요성이 제기된다.
  • 믿음이 매우 빨리 붕괴되는 환경(예: 낮은 노이즈를 가진 결정론적 시스템)에서는 비믿음 기반 방법인 UP-MLE조차도 잘 성능을 내므로, 믿음 추론은 주로 느리게 수렴하거나 매우 불확실한 설정에서 가장 중요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.