Skip to main content
QUICK REVIEW

[논문 리뷰] A New Representation of Successor Features for Transfer across Dissimilar Environments

Majid Abdolshah, Hung Lê|arXiv (Cornell University)|2021. 07. 18.
Gaussian Processes and Bayesian Inference인용 수 4
한 줄 요약

이 논문은 환경의 역학과 보상이 상이한 상황에서도 강화학습에서 효율적인 전이 학습을 가능하게 하는 가우시안 프로세스 기반의 후속 특징 표현을 제안한다. 소스 후속 특징을 타겟 특징의 노이즈 있는 관측값으로 모델링함으로써, 기준선 대비 더 빠른 수렴과 뛰어난 성능을 달성하며, 정책 오차와 수렴에 대한 이론적 경계를 제공한다.

ABSTRACT

Transfer in reinforcement learning is usually achieved through generalisation across tasks. Whilst many studies have investigated transferring knowledge when the reward function changes, they have assumed that the dynamics of the environments remain consistent. Many real-world RL problems require transfer among environments with different dynamics. To address this problem, we propose an approach based on successor features in which we model successor feature functions with Gaussian Processes permitting the source successor features to be treated as noisy measurements of the target successor feature function. Our theoretical analysis proves the convergence of this approach as well as the bounded error on modelling successor feature functions with Gaussian Processes in environments with both different dynamics and rewards. We demonstrate our method on benchmark datasets and show that it outperforms current baselines.

연구 동기 및 목표

  • 소스 작업과 타겟 작업 간에 환경의 역학과 보상 함수가 모두 다를 경우 강화학습에서 전이 학습의 과제를 해결한다.
  • 다양한 환경 간에 일관된 역학을 가정하는 기존 후속 특징 방법의 한계를 극복한다.
  • 기존의 역학이 다를 수 있는 새로운 환경에서 학습을 가속화하기 위해 소스 작업의 사전 지식을 활용할 수 있는 일반화 가능한 프레임워크를 개발한다.
  • 역학적 변화가 발생할 경우 타겟 환경에서 정책 추정에 대한 수렴성과 오차 경계에 대한 이론적 보장을 제공한다.
  • 다양한 복잡도 수준을 가진 다양한 RL 벤치마크에서 기존 기준선 대비 제안된 방법의 경험적 우월성을 입증한다.

제안 방법

  • 가우시안 프로세스(GPs)를 사용하여 후속 특징 함수를 모델링하고, 소스 후속 특징을 타겟 함수의 노이즈 있는 측정값으로 간주한다.
  • 소스 후속 특징의 분포를 타겟 후속 특징 함수 학습을 위한 사전 확률로 활용하여 GP 프레임워크 내에서 모델링한다.
  • 타겟 후속 특징 함수를 소스의 노이즈 있는 실현값으로 설정함으로써, 역학적 변화에 대한 불확실성 인식 기반의 적응을 가능하게 한다.
  • Generalized Policy Improvement(GPI)를 적용하여 학습된 후속 특징을 사용해 타겟 환경에서 행동가치 함수를 추정한다.
  • 각 단계에서 소스 및 타겟 경험 데이터를 모두 GP 모델에 통합하여 점진적 학습과 적응을 가능하게 한다.
  • GP의 예측 분산을 활용하여 타겟 환경에서의 적응 과정 동안 탐색을 이끌고 표본 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1역학이 상당히 다를 수 있는 환경 간에 후속 특징을 효과적으로 전이할 수 있는가?
  • RQ2소스와의 역학이 다를 경우 타겟 환경의 후속 특징에 대한 불확실성을 어떻게 모델링할 수 있는가?
  • RQ3다른 역학을 가진 타겟 환경으로부터 전이된 최적 정책의 오차에 대해 어떤 이론적 경계를 설정할 수 있는가?
  • RQ4후속 특징에 GP 기반 사전 확률을 사용할 경우, 새로운 환경에서 더 빠른 수렴과 향상된 표본 효율성을 달성할 수 있는가?
  • RQ5역학적 변화와 보상 변화가 동시에 발생하는 환경에서 제안된 방법은 기존 후속 특징 전이 접근법과 비교해 어떻게 성능을 냈는가?

주요 결과

  • 10개의 물체가 있는 격자 환경에서 제안된 방법은 FSF 및 LPSF 기준선을 모두 능가하며 더 빠른 수렴과 더 높은 평균 누적 보상치를 기록했다.
  • 봉 길이가 0.5m에서 3.0m로 변경된 CartPole-v0 환경에서, LPSF 및 FSF 대비 뛰어난 성능을 보이며 역학 변화에 대한 강건성을 입증했다.
  • 5% 전이 노이즈와 무작위 종료 상태를 가진 FSF 벤치마크 환경에서, LPSF를 능가하고 초기 학습 단계에서 FSF보다 더 나은 적응 능력을 보였다.
  • GP 기반 모델은 역학이 상당히 다를 경우에도 효과적인 전이를 가능하게 하여, 모든 환경에서 더 빠른 수렴과 더 높은 최종 수익을 달성했다.
  • 이론적 분석을 통해 방법의 수렴성을 확인하고, 타겟 후속 특징에서 유도된 정책의 오차에 상한 경계를 제공했다.
  • 소스 작업의 후속 특징을 사전 확률로 활용함으로써 표본 효율성이 향상되어 타겟 환경에서의 상호작용 횟수가 감소했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.