Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Adversarial Self-Imitation Learning

Yijie Guo, Junhyuk Oh|arXiv (Cornell University)|2018. 12. 03.
Reinforcement Learning in Robotics참고 문헌 22인용 수 41
한 줄 요약

GASIL은 정책이 과거의 좋은 궤적을 모방하도록 장려하는 판별기 기반 정규화 기법으로, GAIL 프레임워크 내의 내부 보상으로 취급되어 PPO를 개선하며 특히 지연 보상에서 더 큰 효과를 보인다.

ABSTRACT

This paper explores a simple regularizer for reinforcement learning by proposing Generative Adversarial Self-Imitation Learning (GASIL), which encourages the agent to imitate past good trajectories via generative adversarial imitation learning framework. Instead of directly maximizing rewards, GASIL focuses on reproducing past good trajectories, which can potentially make long-term credit assignment easier when rewards are sparse and delayed. GASIL can be easily combined with any policy gradient objective by using GASIL as a learned shaped reward function. Our experimental results show that GASIL improves the performance of proximal policy optimization on 2D Point Mass and MuJoCo environments with delayed reward and stochastic dynamics.

연구 동기 및 목표

  • 강화학습에서 장기적 신용 할당을 용이하게 하기 위한 내부 학습 보상의 사용을 촉진한다.
  • 생성적 적대적 프레임워크 내에서 과거의 좋은 궤적 모방을 장려하는 정규화 기법을 개발한다.
  • GASIL이 정책 기울기 방법과 결합되어 도전적인 환경에서 성능을 향상시킬 수 있음을 입증한다.
  • GASIL의 확률적 역학 및 지연 보상 신호에 대한 강건성을 보여준다.

제안 방법

  • discounted return으로 상위-K 과거 궤적을 저장하는 좋은 궤적 버퍼를 정의한다.
  • 현재 정책 궤적과 좋은 궤적을 구분하기 위해 판별기를 훈련한다.
  • GASIL objective를 사용하여 좋은 궤적을 모방함으로써 판별기를 속이도록 정책을 업데이트한다.
  • 판별기를 궤적 전체에서 조밀한 피드백을 제공하는 학습된 보상 함수로 해석한다.
  • 선택적으로 -log D_phi(s,a)로 보상을 형성하여 GASIL을 정책 기울기 목표와 결합한다.
  • GAN 프레임워크와 같이 판별기와 정책이 번갈아 업데이트되는 알고리즘적 단계를 제공한다.

실험 결과

연구 질문

  • RQ1GASIL 개선이 지연되거나 희소 보상 환경에서 표준 PPO보다 달성될 수 있는가?
  • RQ2연속 제어 태스크에서 GASIL이 행동 복제나 자기 모방 학습보다 샘플 효율이 높은가?
  • RQ3다른 정책 기울기 방법과 결합될 때 GASIL이 보완적인가?
  • RQ4제어 태스크에서 GASIL은 확률적 역학에 대해 어느 정도 강건한가?

주요 결과

  • GASIL은 PPSO 성능을 향상시키며, 특히 지연 보상에서 2D Point Mass 및 MuJoCo 태스크에서 성능이 향상된다.
  • GASIL은 MuJoCo 벤치마크에서 행동 복제 및 자기 모방 학습보다 우수하다.
  • 학습된 판별기는 궤적에 걸쳐 조밀한 보상을 제공하여 탐색 및 정책 개선에 도움을 준다.
  • GASIL은 어떤 정도까지는 확률적 역학 하에서도 강건하며, 실험에서 노이즈가 있을 때 성능 차이가 더 커지는 경향이 있다.
  • 지연 보상 MuJoCo 태스크는 비지연 태스크에 비해 GASIL에서 더 큰 이득을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.