Skip to main content
QUICK REVIEW

[논문 리뷰] Learning latent state representation for speeding up exploration

Giulia Vezzani, Abhishek Gupta|arXiv (Cornell University)|2019. 05. 27.
Reinforcement Learning in Robotics참고 문헌 24인용 수 21
한 줄 요약

이 논문은 관련 작업에서의 이전 경험을 활용하여 저차원 잠재 상태 표현을 학습하고, 이를 고차원 연속 환경에서 엔트로피 기반 탐색을 이끄는 메타탐색 방법을 제안한다. 작업 관련 상태 성분에 대해 변분 오토인코더(VAE)를 훈련시음으로써, 전체 상태 엔트로피 최대화나 표준 기준선보다 빠른 수렴을 달성하며, 진정한 보상 관련 상태 공간을 최적화하는 오라클에 근접한 성능을 보인다.

ABSTRACT

Exploration is an extremely challenging problem in reinforcement learning, especially in high dimensional state and action spaces and when only sparse rewards are available. Effective representations can indicate which components of the state are task relevant and thus reduce the dimensionality of the space to explore. In this work, we take a representation learning viewpoint on exploration, utilizing prior experience to learn effective latent representations, which can subsequently indicate which regions to explore. Prior experience on separate but related tasks help learn representations of the state which are effective at predicting instantaneous rewards. These learned representations can then be used with an entropy-based exploration method to effectively perform exploration in high dimensional spaces by effectively lowering the dimensionality of the search space. We show the benefits of this representation for meta-exploration in a simulated object pushing environment.

연구 동기 및 목표

  • 고차원, 희박 보상 환경에서의 효율적 탐색 문제를 해결한다.
  • 이전 경험을 활용하지 않는 작업 무관 탐색 방법의 한계를 극복한다.
  • 관련 작업에서의 이전 경험으로부터 압축된, 작업에 관련된 잠재 표현을 학습하여 효과적 탐색 공간을 줄인다.
  • 이러한 학습된 표현을 최대 엔트로피 탐색 전략에 통합하여 새로운 작업에서 정책 학습을 가속화한다.
  • 모의 조작 작업에서 표현 기반 탐색이 전체 상태 엔트로피 최대화 및 표준 기준선보다 우수한 성능을 보임을 입증한다.

제안 방법

  • 이전 관련 작업의 트레이젝터리에서 공유 인코더 레이어를 가진 다중 헤드 VAE를 훈련시켜, $ p \ll n $ 인 저차원 잠재 표현 $ z = h_{\alpha_{\text{shared}}}(s) \in \mathbb{R}^p $ 를 학습함으로써 작업 관련 상태 성분을 포착한다.
  • VAE의 ELBO(증거 하한)를 $ -\log p(z) $ 의 추정치로 사용하며, 이를 내재적 탐색 보너스로 활용한다.
  • 희박한 외재적 보상 $ R(s) $ 에 음의 ELBO를 더하여 조밀한 내재적 보너스를 형성한다: $ R_{\text{new}}(s) = R(s) - \gamma \cdot \text{ELBO}(z) $.
  • 이 보너스를 정책 기반 강화학습 알고리즘(TRPO 등)에 통합하여 저차원 잠재 공간에서의 탐색을 장려한다.
  • 과거 작업 트레이젝터리에서 추출한 잠재 코드 $ z $ 에 대해 VAE를 훈련시켜, 관련 작업 간에 일반화 가능한 표현을 확보한다.
  • 학습된 표현을 활용해 새로운 작업에서 탐색을 이끌며, 관련 상태 부분공간에 집중하고 탐색 공간의 차원을 감소시킨다.

실험 결과

연구 질문

  • RQ1관련 작업에서의 이전 경험을 활용해 탐색 효율성을 향상시키는 압축된, 작업에 관련된 잠재 표현을 학습할 수 있는가?
  • RQ2잠재 표현을 사용한 엔트로피 최대화가 전체 상태 엔트로피 최대화보다 고차원 강화학습에서 더 빠른 수렴을 이끌 수 있는가?
  • RQ3샘플 효율성 측면에서 표현 기반 탐색은 표준 기준선(예: 보너스 없음, 액션 공간 보너스, 전체 상태 보너스)과 비교해 어떻게 성능을 내는가?
  • RQ4희박 보상 설정에서도 VAE 기반 잠재 표현이 보상 예측에 기여하는 상태 성분을 효과적으로 식별할 수 있는가?
  • RQ5이전 작업에서의 메타학습이 새로운, 알려지지 않은 작업에서의 탐색 성능을 얼마나 향상시키는가?

주요 결과

  • VAE로 학습된 잠재 표현을 사용한 제안된 방법은 진정한 보상 관련 상태(물체 위치)를 최적화하는 오라클 성능에 거의 근접한 평균 수익을 달성한다.
  • 전체 상태 $ s $ 를 사용한 경우에 비해 잠재 표현 $ z $ 를 사용한 성능이 뚜렷이 향상되었으며, 전체 상태 공간에서 엔트로피를 최대화하는 기준선 정책은 훨씬 느린 학습을 보였다.
  • 10개의 새로운 작업에서 평균 수익 측면에서, TRPO에 보너스 없음, 액션 공간 보너스, 전체 상태 엔트로피 보너스를 포함한 표준 기준선보다 모두 우수한 성능을 보였다.
  • VAE 기반 표현은 작업 관련 역학을 효과적으로 포착했으며, 학습된 $ z $ 와 실제 보상 생성 성분 간의 강한 상관관계로 이를 입증했다.
  • 희박 보상이 존재하는 모의 물체 밀기 환경에서 이 방법은 강건성과 샘플 효율성을 입증하였으며, 이전 경험을 통해 효과적인 탐색을 이끌 수 있음을 검증하였다.
  • 결과적으로, 이전 작업에서 분리된 저차원 잠재 공간을 학습하는 것이 원시 상태 공간에 의존하거나 임의의 내재 보너스에 의존하는 것보다 더 효율적인 탐색을 가능하게 한다는 것이 제안된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.