Skip to main content
QUICK REVIEW

[논문 리뷰] Dyna Planning using a Feature Based Generative Model

Ryan Faulkner, Doina Precup|arXiv (Cornell University)|2018. 05. 23.
Reinforcement Learning in Robotics참고 문헌 16인용 수 3
한 줄 요약

이 논문은 고차원 상태 공간(예: 이미지 관측값을 포함한 상태 공간)에서 샘플 효율성을 향상시키기 위해 딥 베이지안 네트워크(DBNs)를 비선형 생성 모델로 사용하여 다이나 강화학습 프레임워크에 통합하는 방법을 제안한다. 제안된 방법은 선형 모델에 비해 학습 속도와 성능에서 뚜렷한 우수성을 보이며, 특히 가치 함수 학습을 위한 고품질 시뮬레이션 트레이젝터리를 생성할 때 유리하다.

ABSTRACT

Dyna-style reinforcement learning is a powerful approach for problems where not much real data is available. The main idea is to supplement real trajectories, or sequences of sampled states over time, with simulated ones sampled from a learned model of the environment. However, in large state spaces, the problem of learning a good generative model of the environment has been open so far. We propose to use deep belief networks to learn an environment model for use in Dyna. We present our approach and validate it empirically on problems where the state observations consist of images. Our results demonstrate that using deep belief networks, which are full generative models, significantly outperforms the use of linear expectation models, proposed in Sutton et al. (2008)

연구 동기 및 목표

  • 기존의 다이나 방법이 어려움을 겪는 큰 또는 연속적인 상태 공간에서 효과적인 생성 모델을 학습하는 데 도전하는 것.
  • 이미지와 같은 복잡한 고차원 관측값을 모델링하기 위해 딥 베이지안 네트워크를 활용하여 강화학습의 샘플 효율성을 향상시키는 것.
  • 다이나 스타일 계획에서 비선형 생성 모델이 선형 기대 모델보다 우수한 성능을 보이는지 입증하는 것.
  • 이미지 기반 관측값과 비결정적인 전이를 포함한 환경에서 접근법을 검증하는 것.

제안 방법

  • 이 방법은 이미지 관측값으로부터 상태의 계층적 비선형 표현을 학습하기 위해 딥 베이지안 네트워크(DBNs)를 사용한다.
  • 각 액션에 따라 현재 상태를 기반으로 다음 상태의 조건부 분포를 모델링하기 위해 두 DBN 사이에 시간적 레이어를 학습시킨다.
  • 각 액션마다 별도의 DBN을 학습시켜 상태 전이를 모델링함으로써 액션 조건부 다음 상태 생성을 가능하게 한다.
  • 생성 모델은 현재 상태 관측값을 입력으로 하여 DBN에서 추론을 수행함으로써 시뮬레이션된 전이를 생성한다.
  • 이러한 시뮬레이션된 전이들은 실제 경험과 함께 결합되어 선형 함수 근사와 함께 TD(0) 학습을 통해 가치 함수를 갱신하는 데 사용된다.
  • 시뮬레이션 샘플의 학습률은 에피소드가 진행됨에 따라 감쇠되며, 옵티마이제이션을 위해 에피소드에 따라 감소하는 에psilon-그리디 탐색 전략을 사용한다.

실험 결과

연구 질문

  • RQ1딥 베이지안 네트워크는 강화학습 환경에서 복잡한 고차원 상태 전이를 효과적으로 모델링할 수 있는가?
  • RQ2다이나 프레임워크에 비선형 생성 모델을 사용할 경우 선형 모델에 비해 더 빠르고 정확한 가치 함수 학습이 이루어지는가?
  • RQ3이미지 기반 관측값과 확률적 역학을 포함한 환경에서 생성 모델의 성능은 어떠한가?
  • RQ4시뮬레이션 트레이젝터리의 품질이 다이나 계획의 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • DBNs를 사용해 학습한 생성 모델은 이미지 관측값으로부터 다음 상태를 높은 정확도로 예측하여 효과적인 시뮬레이션을 가능하게 하였다.
  • DBN 기반 생성 모델을 사용한 다이나는 기준 TD(0)/SARSA에 비해 실제 환경 상호작용 횟수와 총 데이터 양을 줄여도 높은 수익을 달성하는 데 성공하였다.
  • DBN 기반 모델은 선형 모델보다 더 높은 품질의 시뮬레이션 트레이젝터리를 생성하여 더 긴 거리와 더 효과적인 계획을 가능하게 하였다.
  • 선형 모델의 시뮬레이션 전이에서는 약 10단계 이내로 품질이 급격히 악화되어 장기 계획에 대한 활용도가 제한되었다.
  • 실제 단계당 50단계의 시뮬레이션을 수행한 생성 다이나는 뛰어난 성능을 보였으며, 7500회의 환경 단계에서 약 14시간 만에 학습이 완료되었다.
  • 생성 다이나 모델에서 유도된 정책은 시각화된 격자 월드 보행에서 일관되고 목표 향한 행동을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.