Skip to main content
QUICK REVIEW

[논문 리뷰] State2vec: Off-Policy Successor Features Approximators

Sephora Madjiheurem, Laura Toni|arXiv (Cornell University)|2019. 10. 22.
Reinforcement Learning in Robotics참고 문헌 15인용 수 4
한 줄 요약

이 논문은 상태 공간의 기하학적 구조를 고려한 저차원 상태 임베딩을 학습하기 위해 변형된 node2vec 프레임워크를 사용하는 새로운 오프-폴리시 후속 특징 근사기인 state2vec을 제안한다. 탐색적이고 보상에 종속되지 않은 데이터를 기반으로 훈련함으로써, state2vec은 기저 상태 공간의 구조를 포착하여 다양한 정책과 보상 함수에 걸쳐 메타테스트 시 샘플 효율적인 가치 함수 근사가 가능하게 한다.

ABSTRACT

A major challenge in reinforcement learning (RL) is the design of agents that are able to generalize across tasks that share common dynamics. A viable solution is meta-reinforcement learning, which identifies common structures among past tasks to be then generalized to new tasks (meta-test). In meta-training, the RL agent learns state representations that encode prior information from a set of tasks, used to generalize the value function approximation. This has been proposed in the literature as successor representation approximators. While promising, these methods do not generalize well across optimal policies, leading to sampling-inefficiency during meta-test phases. In this paper, we propose state2vec, an efficient and low-complexity framework for learning successor features which (i) generalize across policies, (ii) ensure sample-efficiency during meta-test. We extend the well known node2vec framework to learn state embeddings that account for the discounted future state transitions in RL. The proposed off-policy state2vec captures the geometry of the underlying state space, making good basis functions for linear value function approximation.

연구 동기 및 목표

  • 다양한 최적 정책 간에 일반화 능력이 떨어지고 샘플 효율성이 떨어지는 기존 후속 특징 방법의 문제를 해결하기 위해.
  • 메타학습 기간 동안 작업에 특화된 보상과 정책에서 상태 표현 학습을 분리하기 위해.
  • 환경의 기하학적 구조를 유지하는 저차원의 보상에 종속되지 않은 상태 임베딩을 개발하기 위해.
  • 사전에 훈련된 임베딩 위에 작업에 특화된 계수 벡터를 학습함으로써 메타테스트 시 빠르고 샘플 효율적인 적응을 가능하게 하기 위해.
  • 오프-폴리시 훈련을 통해 후속 특징이 다양한 정책 간에 일반화되도록 보장함으로써 메타강화학습 성능을 향상시키기 위해.

제안 방법

  • 시간적 및 구조적 의존성을 강조하면서 할인된 미래 상태 전이를 코딩하는 상태 임베딩을 학습하기 위해 node2vec 알고리즘을 확장한다.
  • 랜덤 워크 과정에서 미래 전이에 할인 요소를 적용하여 임베딩 공간에서 시간적으로 관련성이 높고 근접한 상태를 우선시한다.
  • 특정 보상 함수나 최적 정책과 독립적인 오프-폴리시 탐색 경험 데이터를 기반으로 state2vec 모델을 훈련한다.
  • 메타테스트 기간 동안 선형 가치 함수 근사의 기저 함수로 학습된 상태 임베딩을 사용한다.
  • 행동 정책가 목표 정책와 다를 경우에도 경험을 활용하여 오프-폴리시 시간차 학습을 수행함으로써 후속 특징 추정치를 업데이트한다.
  • 메타테스트 단계에서의 빠른 적응과 샘플 효율성을 확보하기 위해 임베딩 차원을 낮게 제약한다.

실험 결과

연구 질문

  • RQ1후속 특징의 오프-폴리시 훈련이 메타강화학습에서 다양한 최적 정책 간에 더 나은 일반화를 이끌 수 있는가?
  • RQ2on-policy 방법과 비교했을 때 state2vec 임베딩은 기저 상태 공간의 기하학적 구조를 얼마나 잘 포착하는가?
  • RQ3사전 훈련된 보상에 종속되지 않은 상태 임베딩을 사용할 경우 메타테스트 시 샘플 효율성이 얼마나 향상되는가?
  • RQ4state2vec 임베딩은 새로운 작업에 대해 선형 가치 함수 근사의 효과적인 저차원 기저 함수로 기능할 수 있는가?
  • RQ5value function 근사 정확도와 일반화 능력 측면에서 state2vec는 node2vec 및 기타 후속 특징 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • state2vec는 오프-폴리시 탐색 데이터에서 학습함으로써 진정한 후속 특징의 고정밀도 근사에 성공한다.
  • 오프-폴리시 state2vec 임베딩은 상태 공간의 내재된 기하학적 구조를 포착하여 강건한 가치 함수 근사가 가능하게 한다.
  • state2vec는 저차원의 작업에 특화된 계수 벡터만 학습하면 되므로 샘플 효율적인 메타테스트를 가능하게 한다.
  • state2vec는 node2vec보다 가치 함수 근사에서 뛰어난 성능을 보이며, 임베딩 과정에서 강화학습에 특화된 설계의 이점을 입증한다.
  • 표현 방식은 보상 함수의 변화에 대해 강건하며, 최적 정책이 크게 다를 경우에도 정책 간에 일반화된다.
  • 이 프레임워크는 상태 표현 학습을 정책과 보상에서 분리함으로써, 최소한의 재훈련으로도 작업 간 지식 전이가 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.