Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Dynamics Model in Reinforcement Learning by Incorporating the Long Term Future

Nan Rosemary Ke, Amanpreet Singh|arXiv (Cornell University)|2019. 03. 05.
Reinforcement Learning in Robotics참고 문헌 54인용 수 17
한 줄 요약

이 논문은 모델기반 강화학습에서 장기 예측 성능을 향상시키기 위해 향후 정보를 보조 손실과 역방향 RNN을 통해 통합하는 잠재변수 기반 순차적 모델을 제안한다. 장기 예측 동역학을 학습시킴으로써 더 정확한 계획 수립과 탐색이 가능해지며, PickUnlock 및 CarRacing와 같은 작업에서 기준 모델보다 더 높은 누적 보상 획득 속도를 달성한다.

ABSTRACT

In model-based reinforcement learning, the agent interleaves between model learning and planning. These two components are inextricably intertwined. If the model is not able to provide sensible long-term prediction, the executed planner would exploit model flaws, which can yield catastrophic failures. This paper focuses on building a model that reasons about the long-term future and demonstrates how to use this for efficient planning and exploration. To this end, we build a latent-variable autoregressive model by leveraging recent ideas in variational inference. We argue that forcing latent variables to carry future information through an auxiliary task substantially improves long-term predictions. Moreover, by planning in the latent space, the planner's solution is ensured to be within regions where the model is valid. An exploration strategy can be devised by searching for unlikely trajectories under the model. Our method achieves higher reward faster compared to baselines on a variety of tasks and environments in both the imitation learning and model-based reinforcement learning settings.

연구 동기 및 목표

  • 일보전 예측의 정확도가 떨어지는 데 기인한 모델기반 강화학습의 누적 오류 문제를 해결한다.
  • 즉각적인 전이를 넘어서 향후 상태에 대해 고려할 수 있도록 모델을 훈련시켜 장기 예측 정확도를 향상시킨다.
  • 예측 결과가 유효하고 높은 가능도를 갖는 궤적에 기반하도록 보장함으로써 효율적인 계획 수립과 탐색을 가능하게 한다.
  • 장기 동역학을 모델링하면 복잡한 환경에서 더 빠른 정책 학습과 더 나은 샘플 효율성을 달성할 수 있음을 입증한다.

제안 방법

  • 순차적 관측과 행동을 모델링하기 위해 잠재변수를 사용하는 변분 추론 프레임워크를 사용한다.
  • 잠재변수의 사후 분포가 향후 관측에 의존할 수 있도록 역방향 RNN을 통합하여 장기적 맥락을 통합한다.
  • 보조 손실을 도입하여 잠재변수들이 향후 상태의 요약을 예측하도록 정규화함으로써 장기 예측 일반화 성능을 향상시킨다.
  • 교사-강요 기반 최대우도 추정을 사용해 모델을 훈련하지만, 향후 정보를 고려한 잠재 표현을 통해 오류 누적 문제를 완화한다.
  • 모델이 유효한 분포 내 궤적을 생성할 수 있도록 잠재 공간에서 계획을 수행한다.
  • 모델 하에서 낮은 가능도를 갖는 궤적을 식별하는 기반으로 탐색 전략을 설계하여 에이전트가 새로운 상태로 향하도록 이끈다.

실험 결과

연구 질문

  • RQ1장기적인 미래 동역학을 모델링하면 모델기반 강화학습에서 계획 수립과 정책 학습 성능을 향상시킬 수 있는가?
  • RQ2잠재변수에 향후 정보를 통합하면 순차 모델에서 누적 예측 오류를 줄일 수 있는가?
  • RQ3장기 예측 전이를 학습시킨 모델은 더 효과적인 탐색과 더 빠른 수렴을 가능하게 하는가?
  • RQ4향후 정보를 반영한 잠재 모델링 방식은 표준 일보전 예측 방식에 비해 장기 예측 영상 생성 및 계획 성능에서 어떻게 비교되는가?
  • RQ5핵심 마일스톤에 도달했을 때 예측 오차가 급격히 감소하는 모습을 보이며 모델이 하위목표를 탐지할 수 있는가?

주요 결과

  • CarRacing 환경에서 장기 예측 영상 생성에 대해 -526.0의 음의 로그가능도(NLL)를 기록하여 순환 디코더 기반 모델(NLL: -352.8)보다 뚜렷이 뛰어난 성능을 보였다.
  • PickUnlock 작업에서 모델은 순환 정책 기준 모델보다 일관되게 더 높은 누적 보상을 달성하며 더 빠른 학습과 더 나은 샘플 효율성을 입증했다.
  • 에이전트가 핵심 하위목표(예: 열쇠를 찾거나 문을 열기)에 도달했을 때 예측 오차가 급격히 감소하는 경향을 보이며 효과적인 하위목표 탐지 능력을 입증했다.
  • 모델에서 생성된 시각적 결과는 곡선 도로와 완전한 구조물을 포함한 일관되고 복잡한 장면을 생성한 반면, 기준 모델은 완성되지 않은 또는 직선 도로만 생성했다.
  • 희소 보상이 적용된 바퀴 기반 이동 작업에서 모델은 Sectar 기준 모델을 능가했으며, 이는 A3C, TRPO, Option Critic, FeUdal, VIME보다도 뛰어난 성능을 보였다.
  • 낮은 가능성도 궤적 기반 탐색 전략이 효과적으로 미탐색 영역으로 에이전트를 이끌어내 샘플 효율성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.