Skip to main content
QUICK REVIEW

[논문 리뷰] Intrinsic Reward Driven Imitation Learning via Generative Model

Xingrui Yu, Yueming Lyu|arXiv (Cornell University)|2020. 06. 26.
Reinforcement Learning in Robotics인용 수 12
한 줄 요약

이 논문은 아타리 게임에서 단일 생애 주기 시범을 바탕으로 내재 보상(reward)을 학습하기 위해 조건부 변동 자료열기(VAE)를 사용하는 새로운 방법인 생성적 내재 보상 유도 복제 학습(GIRIL)을 제안한다. 전방 상태 전이와 후방 행동 인코딩을 모델링함으로써 생성 모델은 자기 지도적 탐색을 가능하게 하여, 에이전트가 시범자 성과를 초월하는 성능을 달성할 수 있도록 한다—최대 5배의 보상 수준을 기록한다.

ABSTRACT

Imitation learning in a high-dimensional environment is challenging. Most inverse reinforcement learning (IRL) methods fail to outperform the demonstrator in such a high-dimensional environment, e.g., Atari domain. To address this challenge, we propose a novel reward learning module to generate intrinsic reward signals via a generative model. Our generative method can perform better forward state transition and backward action encoding, which improves the module's dynamics modeling ability in the environment. Thus, our module provides the imitation agent both the intrinsic intention of the demonstrator and a better exploration ability, which is critical for the agent to outperform the demonstrator. Empirical results show that our method outperforms state-of-the-art IRL methods on multiple Atari games, even with one-life demonstration. Remarkably, our method achieves performance that is up to 5 times the performance of the demonstration.

연구 동기 및 목표

  • 단일 생애 주기 시범만으로도 고차원 환경인 아타리에서 전문가 수준의 성능과 그 이상의 성능을 달성하는 데 도전한다.
  • 데이터 부족과 보상 편향으로 인해 전통적인 역강화학습(IRL)과 행동 복제(BC)가 시범자 성과를 따라잡지 못하는 한계를 극복한다.
  • 생성 모델을 통해 내재 보상의 일련을 생성함으로써 저자료 환경에서 효과적인 탐색과 정책 최적화를 가능하게 한다.
  • 조건부 VAE를 사용해 전방 상태 전이와 후방 행동 인코딩을 동시에 학습함으로써 역학 모델링을 향상시킨다.
  • 최신의 IRL 및 궁금증 기반 방법보다 뛰어난 복제 성능을 달성한다—최소한의 시범 데이터로도 가능하다.

제안 방법

  • 전방 역학을 조건부 디코더로 모델링하고 후방 행동 인코딩을 조건부 인코더로 모델링하는 조건부 VAE 기반의 생성 내재 보상 학습(GIRL) 모듈을 제안한다.
  • VAE를 사용해 현재 상태와 행동에서 다양한 미래 상태를 생성하고, 미래 상태에서 행동을 재구성함으로써 역학 모델 정확도를 향상시킨다.
  • 재구성 오차와 전이 가능성 기반으로 내재 보상을 일련 생성함으로써 샘플링 기반 자기 지도적 탐색을 가능하게 한다.
  • 누적 수익을 최대화하기 위해 Proximal Policy Optimization(PPO)를 내재 보상 함수에 적용해 정책을 훈련시킨다.
  • 식 (6)에 정의된 재구성 손실을 사용해 보상 계산 전에 상태와 예측 상태를 [-1, 1]로 정규화한다.
  • 학습률 3e-4로 보상 학습 모듈을 최적화하고, GAE를 γ=0.95로 설정하고 엔트로피 계수를 0.0으로 설정한 표준 PPO 초모수를 사용한다.

실험 결과

연구 질문

  • RQ1생성 모델이 단일 생애 주기 시범만으로도 고차원 환경에서 시범자 성과를 초월하는 내재 보상 신호를 학습할 수 있는가?
  • RQ2전방 상태 전이와 후방 행동 인코딩을 함께 모델링함으로써 역학 모델링이 향상되고, 이로 인해 더 나은 탐색과 정책 학습이 가능한가?
  • RQ3제안된 GIRIL 방법은 최신의 IRL 및 궁금증 기반 방법과 비교해 복제 성능 및 샘플 효율성 측면에서 어떻게 다른가?
  • RQ4VAE 기반 생성 모델을 통해 생성된 내재 보상은 자기 지도적 탐색을 지원하며 아타리 게임에서 초인 수준의 성능을 달성할 수 있는가?
  • RQ5조건부 VAE를 통한 역학 모델링의 품질이 저자료 복제 학습 환경에서 최종 정책 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • GIRIL은 GAIL 및 VAIL을 포함한 최신 IRL 방법보다 연속 제어 과제와 아타리 게임 모두에서 뛰어난 성능을 보이며, 평가된 모든 설정에서 최고의 평균 수익을 기록했다.
  • InvertedPendulum 및 InvertedDoublePendulum 과제에서 GIRIL은 각각 평균 수익 990.2와 9,164.9를 달성했으며, CDIL(979.7 및 7,114.7)과 GAIL(113.6 및 725.2)을 모두 초월했다.
  • 아타리 게임에서 GIRIL은 단일 생애 주기 시범으로도 시범자 성과의 최대 5배에 달하는 성능을 기록했다.
  • 전체 에피소드 시범 수가 증가함에 따라 GIRIL은 평가된 모든 게임과 과제에서 일관되게 최고 성능을 기록했다.
  • 제거 실험에서 전방 역학과 후방 행동 인코딩의 동시 모델링이 베이스라인 대비 성능 향상에 크게 기여하는 것으로 확인되었다.
  • 이 방법은 강건성과 확장성을 보이며, 다양한 랜덤 시드와 다양한 환경에서 뛰어난 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.