Skip to main content
QUICK REVIEW

[논문 리뷰] Data-Efficient Reinforcement Learning in Continuous-State POMDPs

Rowan McAllister, Carl Edward Rasmussen|arXiv (Cornell University)|2016. 02. 08.
Energy Efficient Wireless Sensor Networks참고 문헌 7인용 수 4
한 줄 요약

이 논문은 관측 불확실성 하에서 강력한 제어를 가능하게 하기 위해, 신뢰도 상태 필터링을 궤적 예측에 통합함으로써 데이터 효율적인 PILCO 알고리즘을 부분 관측 마르코프 결정 과정(POMDP)으로 확장한다. 동역학과 필터링 과정을 모두 거쳐 모델 불확실성을 전파함으로써, 비선형적이고 노이즈가 많은 환경(예: 카트폴 스윙업 작업)에서 단순한 필터링을 적용하지 않은 정책 최적화에 비해 유의미하게 높은 성능을 달성한다.

ABSTRACT

We present a data-efficient reinforcement learning algorithm resistant to observation noise. Our method extends the highly data-efficient PILCO algorithm (Deisenroth & Rasmussen, 2011) into partially observed Markov decision processes (POMDPs) by considering the filtering process during policy evaluation. PILCO conducts policy search, evaluating each policy by first predicting an analytic distribution of possible system trajectories. We additionally predict trajectories w.r.t. a filtering process, achieving significantly higher performance than combining a filter with a policy optimised by the original (unfiltered) framework. Our test setup is the cartpole swing-up task with sensor noise, which involves nonlinear dynamics and requires nonlinear control.

연구 동기 및 목표

  • 부분 관측성과 센서 노이즈 하에서 강화학습의 데이터 비효율성과 모델 편향 문제를 해결하기 위해.
  • 모델 기반 강화학습에서 매우 데이터 효율적인 알고리즘인 PILCO를 신뢰도 상태 예측에 필터링을 통합함으로써 POMDP 환경으로 확장하기 위해.
  • 관측 노이즈로 인한 성능 저하를 방지하기 위해, 전체 관측 가능성을 가정하는 대신 필터링 과정을 통해 궤적을 예측함으로써 비선형 시스템에서의 성능 저하를 완화하기 위해.
  • 동역학과 함께 신뢰도 상태에 대한 모델 불확실성 전파를 통해 단일 모델 편향을 방지함으로써 데이터 효율성을 유지하기 위해.

제안 방법

  • 확률적 동역학과 베이지안 필터링을 조합한 신뢰도 상태 동역학 모델을 제안하여 불확실성 하에서 시스템 궤적을 예측한다.
  • 모멘트 매칭 기법과 가우시안 근사를 사용하여 신뢰도 평균과 공분산을 분석적으로 계산함으로써, EKF에 비해 근사 오차를 감소시킨다.
  • 신뢰도 상태와 동역학 모델 간의 공동 분포를 도입함으로써, 필터링과 정책 평가 양쪽 모두를 거쳐 불확실성 전파를 가능하게 한다.
  • 동역학 모델의 사후 분포에 대한 기대값을 사용하여, 신뢰도 평균, 입력-출력 공분산, 그리고 신뢰도 분산에 대한 해석적 표현을 유도한다.
  • 신뢰도 상태 동역학을 통해 역전파를 수행함으로써 정책 기울기 최적화를 적용하여 종단 간 학습을 가능하게 하는 강력한 정책을 학습한다.
  • 시스템을 표현하기 위해 확률적 커널 기반 동역학 모델(GP)을 사용하여, 모든 가능성이 있는 동역학 함수에 대한 마진화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1관측 노이즈에 강건한 성능을 유지하면서, 데이터 효율적인 모델 기반 강화학습 알고리즘을 POMDP로 확장할 수 있는가?
  • RQ2궤적 예측에 필터링을 통합할 경우, 실행 중에만 필터링을 적용하는 것보다 정책 성능이 향상되는가?
  • RQ3동역학과 함께 신뢰도 상태에 대한 모델 불확실성 전파가 낮은 데이터 환경에서의 모델 편향을 어떻게 감소시키는가?
  • RQ4동역학 모델에 대한 전체 사후 추론을 사용할 경우, 비선형적이고 부분 관측 가능한 시스템에서 성능에 어떤 영향을 미치는가?
  • RQ5노이즈가 있는 관측이 존재하는 비선형 시스템에 대해, 분석적 신뢰도 상태 예측을 효율적으로 유도할 수 있는가?

주요 결과

  • 중간 수준의 관측 노이즈 하에서 카트폴 스윙업 작업에서 기존 PILCO에 비해 유의미하게 높은 성능을 달성하여, 더 강건한 성능을 입증한다.
  • 예측 단계에서 필터링을 고려한 정책 최적화가 실행 중에만 필터링을 적용하는 방법보다 성능이 뛰어나며, 예측된 상태와 실제 상태 간의 불일치를 제거한다.
  • 모멘트 매칭을 사용한 분석적 신뢰도 상태 예측은 비선형성이 높을수록 EKF에 비해 근사 오차를 감소시켜, 특히 높은 비선형성 하에서 유리하다.
  • 모든 가능성이 있는 동역학 모델에 대해 마진화함으로써, 낮은 데이터 환경에서도 모델 편향을 줄이며 데이터 효율성을 유지한다.
  • 실험 결과, 예측 단계에서 필터링을 수행함으로써 관측 노이즈가 정 polit을 불안정하게 만들 수 있는 상황에서도 카트폴 시스템의 안정적 제어가 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.