Skip to main content
QUICK REVIEW

[논문 리뷰] PlanGAN: Model-based Planning With Sparse Rewards and Multiple Goals

Henry Charlesworth, Giovanni Montana|arXiv (Cornell University)|2020. 06. 01.
Reinforcement Learning in Robotics참고 문헌 39인용 수 18
한 줄 요약

PlanGAN은 조건부 GAN의 앙상블을 사용하여 실현 가능한 목표 지향 경로를 생성하는 모델 기반 강화학습 알고리즘으로, 희박 보상 및 다중 목표 환경에서 효율적인 계획을 가능하게 한다. 이는 Hindsight Experience Replay(HER)와 같은 최신 모델리스 방법과 유사한 성능을 달성하면서도 환경 상호작용 수가 4–8배 적게 필요한 샘플 효율성이 뛰어나다.

ABSTRACT

Learning with sparse rewards remains a significant challenge in reinforcement learning (RL), especially when the aim is to train a policy capable of achieving multiple different goals. To date, the most successful approaches for dealing with multi-goal, sparse reward environments have been model-free RL algorithms. In this work we propose PlanGAN, a model-based algorithm specifically designed for solving multi-goal tasks in environments with sparse rewards. Our method builds on the fact that any trajectory of experience collected by an agent contains useful information about how to achieve the goals observed during that trajectory. We use this to train an ensemble of conditional generative models (GANs) to generate plausible trajectories that lead the agent from its current state towards a specified goal. We then combine these imagined trajectories into a novel planning algorithm in order to achieve the desired goal as efficiently as possible. The performance of PlanGAN has been tested on a number of robotic navigation/manipulation tasks in comparison with a range of model-free reinforcement learning baselines, including Hindsight Experience Replay. Our studies indicate that PlanGAN can achieve comparable performance whilst being around 4-8 times more sample efficient.

연구 동기 및 목표

  • 희박 보상과 다중 목표가 존재하는 강화학습 환경에서 표준 방법이 희귀한 피드백으로 인해 성능을 내기 어려운 문제를 해결한다.
  • HER와 같은 모델리스 접근 방식의 샘플 비효율성을 극복하기 위해, 궤적 정보를 더 효과적으로 활용하는 모델 기반 대안을 도입한다.
  • 다양하고 실현 가능한 미래 궤적을 목표 상태에 조건화하여 생성함으로써, 직접적인 환경 상호작용 없이도 효율적인 계획을 수행할 수 있는 방법을 개발한다.
  • 로봇 조작 및 주행 과제에서 데이터 효율성을 향상시키기 위해 동역학 모델을 학습하고, 상상 속 궤적을 사용해 계획을 수립한다.
  • 모델 기반 계획에서 조건부 GAN을 사용할 경우, 모델리스 방법과 동일한 점점 도달 성능를 달성하면서도 훨씬 적은 환경 상호작용 수를 요구할 수 있음을 입증한다.

제안 방법

  • 초기 상태와 목표 상태를 조건으로 하여 미래 궤적을 생성하는 Generative Adversarial Networks(GAN)의 앙상블을 훈련하여, 실현 가능한 행동 및 상태 시퀀스를 생성하도록 학습한다.
  • 단일 스텝 예측 모델을 GAN 훈련 중 정규화 기법으로 사용하여, 짧은 수평선에서 생성된 궤적의 정확성과 일관성을 향상시킨다.
  • 다양한 상상 속 궤적을 평가하기 위해 그 가능성과 목표 도달 가능성에 기반해 점수를 매기고, 각 단계에서 최적의 행동을 선택하는 계획 알고리즘을 구현한다.
  • 실제 환경과의 상호작용 없이도 미래 결과를 시뮬레이션할 수 있도록, 생성된 궤적을 몬테카를로 스타일의 계획 과정에 통합한다.
  • 궤적 내에서 관측된 임의의 목표는 이전 상태를 그 목표를 달성하기 위한 시작점으로 재정의할 수 있다는 점을 활용하며, HER와 유사한 전략을 모델 기반 생성 프레임워크에서 적용한다.
  • 다양한 상상 속 궤적을 전개하여 각 후보 행동의 성공 확률을 평가하고, 목표 향한 기대 수익이 가장 높은 행동을 선택하는 계획기 구현

실험 결과

연구 질문

  • RQ1모델 기반 접근 방식이 희박 보상 및 다중 목표 환경에서 HER와 같은 최신 모델리스 방법과 유사한 성능를 달성하면서도 상당히 더 높은 샘플 효율성을 확보할 수 있는가?
  • RQ2조건부 GAN이 복잡한 제어 과제에서 다양하고 실현 가능하며 목표 지향적인 궤적을 생성하는 데 얼마나 효과적인가?
  • RQ3계획기 구성 요소가 전체 성능에 미치는 영향은 무엇이며, 성능 저하 없이 간소화하거나 대체할 수 있는가?
  • RQ4앙상블 내 GAN의 수가 장기 수평선 과제에서 훈련 안정성과 최종 성능에 미치는 영향은 어떠한가?
  • RQ5단일 스텝 예측 모델을 정규화 기법으로 도입할 경우, 생성된 궤적의 품질과 신뢰성 향상에 얼마나 기여하는가?

주요 결과

  • PlanGAN는 희박 보상 및 다중 목표 강화학습 분야에서 현재 최고 수준의 모델리스 방법인 Hindsight Experience Replay(HER)와 유사한 성능를 달성한다.
  • 다양한 로봇 조작 및 주행 과제에서 PlanGAN는 HER보다 4–8배 더 높은 샘플 효율성을 보이며, 동일한 성능 수준에 도달하기 위해 훨씬 적은 환경 상호작용 수를 요구한다.
  • 전용 계획기의 존재는 필수적이다: 계획기를 제거하고 GAN가 예측한 행동을 직접 사용할 경우 성공률가 크게 하락하며, 이는 계획기가 궤적 평가 및 행동 선택에 핵심적인 역할을 한다는 것을 시사한다.
  • 5개의 GAN으로 구성된 앙상블은 1개 또는 3개의 GAN 앙상블보다 略적으로 더 높은 성능를 보이며, 이는 합리적인 범위 내에서 앙상블 크기에 대해 강건함을 시사한다.
  • 단일 스텝 예측 모델 정규화 기법은 성능 향상에 미미한 기여만을 하며, 성능에 결정적인 영향을 주지 않지만 훈련 안정성 향상에 기여할 수 있다.
  • 자체 생성된 시범 데이터가 없는 환경(예: SLD)에서도 PlanGAN는 데이터 효율성에서 그에 비해 뛰어난 성능를 보이며, 이는 희박 보상 환경에서의 생성 기반 계획 메커니즘의 강력함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.