Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning

Yannick Schroecker, Charles L. Isbell|arXiv (Cornell University)|2020. 02. 15.
Reinforcement Learning in Robotics참고 문헌 37인용 수 7
한 줄 요약

이 논문은 후행 경험에서 가치 밀도를 추정하기 위해 정규화 플로우를 사용하는 새로운 방법인 Universal Value Density Estimation (UVDE)를 소개한다. 이는 편향이 없고 샘플 효율적인 목표 조건부 강화 학습 및 이민 학습을 가능하게 하며, 단 한 개의 시연 트랙토리로도 기존의 GAIL을 능가하는 최신 기술 성능을 달성한다.

ABSTRACT

This work considers two distinct settings: imitation learning and goal-conditioned reinforcement learning. In either case, effective solutions require the agent to reliably reach a specified state (a goal), or set of states (a demonstration). Drawing a connection between probabilistic long-term dynamics and the desired value function, this work introduces an approach which utilizes recent advances in density estimation to effectively learn to reach a given state. As our first contribution, we use this approach for goal-conditioned reinforcement learning and show that it is both efficient and does not suffer from hindsight bias in stochastic domains. As our second contribution, we extend the approach to imitation learning and show that it achieves state-of-the art demonstration sample-efficiency on standard benchmark tasks.

연구 동기 및 목표

  • 스토케스틱 도메인에서 낮은 확률의 행동을 과도하게 추정하는 후행 경험 재편성(HER)의 내재된 편향을 해결하기 위해.
  • 가치 밀도 추정을 통해 효율적인 목표 조건부 강화 학습 및 이민 학습을 가능하게 하는 통합 프레임워크를 개발하기 위해.
  • 대부분의 보상 형태에 의존하지 않고 전문가의 상태-행동 분포를 일치시킴으로써 이민 학습의 샘플 효율성을 향상시키기 위해.
  • 자기 주도적 롤아웃을 통해 시연된 상태에 목표 조건부 Q함수를 조건화함으로써 관찰 전용 데이터에서의 학습을 가능하게 하기 위해.

제안 방법

  • 이 방법은 정규화 플로우(특히 RealNVP)를 사용해 가치 밀도를 추정하며, 이는 주어진 상태-행동 쌍에서 목표를 달성할 수 있는 할인된 가능성에 해당한다.
  • 후행 샘플—즉, 상태-행동-달성된 목표 트리플릿—을 활용해 밀도 추정기를 훈련함으로써 장기 예상 보상의 편향 없는 추정이 가능해진다.
  • 가치 밀도는 표준 시간 차분 학습과 결합되어 목표 조건부 Q함수를 업데이트하며, 이는 저분산 및 편향 없는 학습을 보장한다.
  • 이민 학습에서는 시연된 상태를 목표로 샘플링함으로써 에이전트를 훈련시켜 전문가의 상태 분포를 일치시키도록 유도한다.
  • 이 방법은 전문가의 데이터를 판별기 훈련에 직접 사용하지 않고, Q함수를 조건화하는 데만 사용함으로써 적대적 훈련을 피한다.
  • 이 방법은 목표 조건부 강화 학습과 이민 학습 모두에 적용되며, 아블레이션 연구를 통해 고차원적이고 스트로스틱 환경에서 뛰어난 강인성을 입증한다.

실험 결과

연구 질문

  • RQ1후행 샘플을 사용해 가치 밀도를 추정하는 방식으로 목표 조건부 강화 학습에서 후행 편향을 제거할 수 있는가?
  • RQ2가치 밀도 추정이 적대적 보상 형상화에 의존하지 않고도 샘플 효율적인 이민 학습을 가능하게 할 수 있는가?
  • RQ3복잡한 이동 작업에서 GAIL과 비교해 본다면, 제안된 방법은 시연 효율성 측면에서 어떻게 성과를 내는가?
  • RQ4가치 밀도 추정이 고차원 제어 환경에서 관찰 전용 데이터에서 효과적인 학습을 가능하게 하는가?
  • RQ5기존의 HER가 높은 실패율로 인해 실패하는 복잡하고 스트로스틱 환경에서도 이 방법이 일반화 가능한가?

주요 결과

  • VDI는 단 한 개의 서브샘플된 시연 트랙토리만으로 HalfCheetah-v2에서 전문가 수준의 성능을 달성했으며, 동일 조건에서 GAIL를 능가한다.
  • Humanoid-v2-NonExploitable 환경에서 VDI는 단 한 개의 시연 트랙토리로도 전문가를 성공적으로 모방했으며, GAIL는 더 적은 수의 시연로 성능이 급격히 악화되었다.
  • 이 방법은 희박한 보상 환경에서도 강인하며, 정규화 플로우를 사용해 후행 샘플에서 직접 가치 밀도를 추정함으로써 후행 편향을 피한다.
  • VDI는 적대적 판별기 없이 자기 주도적 롤아웃에서 유도된 목표 조건부 Q함수를 학습함으로써 GAIL보다 더 높은 시연 샘플 효율성을 확보한다.
  • 이 방법은 관찰 전용 데이터에서 효과적인 이민 학습을 가능하게 하며, HalfCheetah-v2에서 상태 분포 일치만으로도 성공을 달성함을 입증했다.
  • Humanoid-v2 환경에서 시연된 행동을 목표로 포함시키면 탐색 성능이 크게 향상되며, 이는 상태-행동 분포 일치가 고차원 설정에서 학습을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.