Skip to main content
QUICK REVIEW

[논문 리뷰] Universal Successor Features for Transfer Reinforcement Learning

Chen Ma, Dylan R. Ashley|arXiv (Cornell University)|2020. 01. 05.
Reinforcement Learning in Robotics참고 문헌 18인용 수 11
한 줄 요약

이 논문은 강화학습에서 이식 가능한 지식 표현으로 일반화된 후계자 표현(USR)을 제안하며, 목표에 대해 후계자 표현을 일반화하여 새로운 작업에 빠르게 적응할 수 있도록 한다. 목표 조건부 후계자 기능을 예측하기 위해 딥 네ural 네트워크를 훈련시킴으로써 USR은 랜덤 초기화보다 정책 학습을 훨씬 빠르게 초기화할 수 있으며, 격자 세계 환경에서 미리 보지 않은 목표에서 강력한 제로샷 전이 성능을 달성한다.

ABSTRACT

Transfer in Reinforcement Learning (RL) refers to the idea of applying knowledge gained from previous tasks to solving related tasks. Learning a universal value function (Schaul et al., 2015), which generalizes over goals and states, has previously been shown to be useful for transfer. However, successor features are believed to be more suitable than values for transfer (Dayan, 1993; Barreto et al.,2017), even though they cannot directly generalize to new goals. In this paper, we propose (1) Universal Successor Features (USFs) to capture the underlying dynamics of the environment while allowing generalization to unseen goals and (2) a flexible end-to-end model of USFs that can be trained by interacting with the environment. We show that learning USFs is compatible with any RL algorithm that learns state values using a temporal difference method. Our experiments in a simple gridworld and with two MuJoCo environments show that USFs can greatly accelerate training when learning multiple tasks and can effectively transfer knowledge to new tasks.

연구 동기 및 목표

  • 다양한 목표와 보상 함수를 가진 다양한 강화학습 작업 간의 지식 전이 문제를 해결한다.
  • 역동성과 보상 함수 양쪽 모두에 일반화하기 어려운 유니버설 밸류 함수의 한계를 극복한다.
  • 전이 역동성만 일반화하는 후계자 표현 프레임워크를 개발하여 더 안정적이고 효과적인 전이를 가능하게 한다.
  • 오프-폴리시 경험을 사용하여 유니버설 후계자 표현(USR)을 엔드 투 엔드로 근사하는 딥 러닝 아키텍처를 설계한다.
  • USR 초기화가 랜덤 초기화보다 새로운 작업에서 수렴 속도가 빠르다는 것을 입증한다.

제안 방법

  • 환경의 보상 함수를 상태-행동-상태 특징과 가중치 벡터의 선형 조합으로 분해한다: $ r(s_t,a_t,s_{t+1}) = \mathbf{\phi}(s_t,a_t,s_{t+1})^\top \mathbf{w} $.
  • 정책 조건부 목표에 대한 후계자 표현 $ \mathbf{\psi}^\pi(s, \text{goal}) $ 를 정의한다: 상태에서 정책에 따라 조건부로 얻는 기대 할인 특징의 합이다.
  • 시간 차이 손실을 사용하여 딥 네ural 네트워크를 훈련시켜 $ \mathbf{\psi}(s, g; \theta_\psi) $ 를 예측한다: $ L_\psi = \| \mathbf{\phi}(s_t) + \gamma_t \mathbf{\psi}(s_{t+1}, g; \theta_\psi) - \mathbf{\psi}(s_t, g; \theta_\psi) \|_2^2 $.
  • 보상 예측 오차에 대해 경사 하강법을 사용하여 보상 가중치 벡터 $ \mathbf{w}(g; \theta_w) $ 를 동시에 훈련한다: $ L_w = [r_t - \mathbf{\phi}(s_{t+1})^\top \mathbf{w}(g; \theta_w)]^2 $.
  • 예측된 후계자 기능과 보상 가중치를 사용하여 액터-크리틱 업데이트를 통해 정책 향상의 이점 신호를 계산한다.
  • 사전에 알려지지 않은 타겟 목표에서 정책을 초기화하기 전에 소스 목표 집합에서 USR 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1후계자 표현을 목표에 대해 일반화함으로써 강화학습에서 효과적인 전이 학습이 가능한가?
  • RQ2전이 역동성만 일반화하는 유니버설 후계자 표현(USR)을 훈련시키면 유니버설 밸류 함수보다 더 나은 전이 성능을 보일까?
  • RQ3일부 목표에서 훈련된 USR 모델이 랜덤 정책 초기화보다 새로운, 보지 않은 목표에서 더 빠르게 학습할 수 있는가?
  • RQ4원시 픽셀 관측을 사용하는 시각적 격자 세계 환경에서 USR은 목표 간에 얼마나 잘 일반화되는가?
  • RQ5USR 기반 초기화는 후속 정책 학습에서 샘플 복잡도를 얼마나 줄이는가?

주요 결과

  • USR 모델은 목표 간에 후계자 표현을 성공적으로 일반화하여 네 방 격자 세계 환경에서 보지 않은 타겟 목표로 효과적인 제로샷 전이를 가능하게 하였다.
  • 64개 목표 중 48개 목표에서 훈련된 USR로 초기화된 에이전트는 나머지 16개의 보지 않은 목표에서 랜덤 초기화보다 훨씬 빠른 학습을 달성하였다.
  • USR 모델은 보지 않은 목표에서 강력한 일반화 성능을 보였으며, 정책 학습에서 더 빠른 수렴과 향상된 샘플 효율성을 보였다.
  • 보상 특징과 후계자 표현의 공동 최적화를 사용한 제안된 훈련 알고리즘은 안정적이고 효과적인 정책 학습을 달성하였다.
  • USR을 인덕티브 바이어스로 사용함으로써 새로운 작업에 더 빠르게 적응할 수 있었으며, 이는 강화학습에서 이식 가능한 지식 표현으로서의 가치를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.