Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Model-Free Reinforcement Learning Using Gaussian Process

Ying Fan, Letian Chen|arXiv (Cornell University)|2018. 12. 11.
Reinforcement Learning in Robotics참고 문헌 20인용 수 5
한 줄 요약

이 논문은 연속적인 상태 공간에서 효율적인 탐색을 가능하게 하기 위해 가우시안 프로세스에 대한 사후 샘플링을 사용하는 모델 프리 레이어닝 알고리즘인 GPPSTD를 제안한다. 다양한 시연—최적의 것 외에도 부분 최적의 것들—을 통합함으로써 Q-값 추정의 불확실성을 감소시켜 기존 기준 방법에 비해 더 빠른 수렴과 향상된 샘플 효율성을 달성한다.

ABSTRACT

Efficient Reinforcement Learning usually takes advantage of demonstration or good exploration strategy. By applying posterior sampling in model-free RL under the hypothesis of GP, we propose Gaussian Process Posterior Sampling Reinforcement Learning(GPPSTD) algorithm in continuous state space, giving theoretical justifications and empirical results. We also provide theoretical and empirical results that various demonstration could lower expected uncertainty and benefit posterior sampling exploration. In this way, we combined the demonstration and exploration process together to achieve a more efficient reinforcement learning.

연구 동기 및 목표

  • 연속적인 상태 공간에서 높은 샘플 효율성을 달성하는 모델 프리 레이어닝 강화 학습 알고리즘을 개발하는 것.
  • 최적, 부분 최적, 실패한 시범들을 포함한 다양한 형태의 인간 시범을 탐색 과정에 통합하여 가치 함수 추정의 불확실성을 감소시키는 것.
  • 가우시안 프로세스 기반 Q-값 모델에서 시범의 사용이 기대 불확실성을 감소시키는 데 이론적으로 타당한 근거를 제공하는 것.
  • 실험적으로 시범과 사후 샘플링 탐색을 조합함으로써 더 빠른 학습과 낮은 회귀를 달성하는지 확인하는 것.

제안 방법

  • GPPSTD 알고리즘은 Q-함수의 공동 가우시안 프로세스 모델에 대해 사후 샘플링을 적용하여, 학습된 환경 모델이 필요 없이도 효율적인 탐색을 가능하게 한다.
  • 상태-행동 쌍의 유사도를 모델링하기 위해 제곱 지수 커널을 사용하며, 서로 다른 행동들 간의 독립성을 확보하기 위해 길이 척도를 0으로 설정한다.
  • 시범 데이터는 GP 모델의 사전 훈련에 사용되어 초기 사후 분산을 감소시키고, 이로 인해 Q-값 추정의 기대 불확실성이 낮아진다.
  • 이론적 분석을 통해 GPPSTD는 결정성 환경 하에서 Õ(√(HT))의 베이즈 회귀 경계를 달성하고, 개별 상태에 대해서는 Õ(√(T/H))의 베이지안 추정 오차 경계를 확보한다.
  • 알고리즘은 GP 사후 분포에서 샘플을 추출하고 가장 높은 샘플 Q-값을 가진 행동을 선택하는 방식으로 탐색과 이용의 균형을 이룬다.
  • 이 프레임워크는 특정 조건 하에서 GP와 BNN이 밀접하게 관련되어 있으므로, 베이지안 신경망으로 이론적으로 확장 가능하다.

실험 결과

연구 질문

  • RQ1가우시안 프로세스 모델에 대한 사후 샘플링이 연속적인 상태 공간에서 모델 프리 레이어닝 강화 학습에 대해 이론적으로 타당하고 효율적인 탐색을 제공할 수 있는가?
  • RQ2최적의 것 외에도 다양한 시범—부분 최적의 것들—을 어떻게 활용하여 Q-값 추정의 불확실성을 감소시키고 학습 효율성을 향상시킬 수 있는가?
  • RQ3시범과 사후 샘플링 탐색을 조합하면 표준 탐색 전략에 비해 실질적으로 더 낮은 회귀와 더 빠른 수렴을 달성할 수 있는가?
  • RQ4시범 데이터로부터 기대 불확실성 감소의 이론적 이점이 표준 제어 벤치마크에서 실증적으로 검증될 수 있는가?
  • RQ5GP 기반 프레임워크는 강화 학습에서 베이지안 신경망으로 얼마나 일반화될 수 있는가?

주요 결과

  • GPPSTD는 CartPole 환경에서 ε-그리디를 사용하는 GPTD와 딥 Q-네트워크에 비해 유의미하게 뛰어난 샘플 효율성과 강건성을 보이며, 성능이 뛰어나다.
  • 다양한 시범—부분 최적의 시범과 실패한 궤적 포함—을 사용할 경우, 오직 최적의 시범만 사용할 경우보다 초기 사후 분산(행동 불확실성)이 낮아진다.
  • 5개의 최적 및 5개의 부분 최적 시범을 사용한 다양한 사전 훈련 설정이 가장 낮은 회귀와 가장 뛰어난 성능을 기록했으며, 최적의 시범만 사용한 사전 훈련이나 사전 훈련 없이 사용한 경우보다 뛰어나다.
  • 최적의 시범만 사용한 사전 훈련은 추정의 분산이 더 높고 성능이 불안정하게 나타나, 다양한 시범이 불확실성을 더 효과적으로 감소시킨다는 것을 확인한다.
  • 이론적 분석은 시범이 GP 모델의 기대 불확실성을 감소시켜, 이로 인해 사후 샘플링 기반 탐색의 효율성이 향상됨을 확인한다.
  • 실증 결과는 GP 기반 모델이 특히 시범 데이터와 조합했을 때 딥 네트워크보다 샘플 효율성이 뛰어나다는 것을 보여주며, CartPole 과제에서 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.