Skip to main content
QUICK REVIEW

[논문 리뷰] PLAS: Latent Action Space for Offline Reinforcement Learning

Wenxuan Zhou, Sujay Bajracharya|arXiv (Cornell University)|2020. 11. 14.
Reinforcement Learning in Robotics참고 문헌 22인용 수 13
한 줄 요약

이 논문은 오프라인 강화학습을 위한 PLAS(잠재 행동 공간 내 정책)를 제안한다. 이 방법은 조건부 Variational Autoencoder(CVAE)를 통해 학습된 잠재 공간에서 정책을 훈련시켜, 액션을 데이터셋의 지지역역에 암묵적으로 제약하는 방식이다. 이 접근법은 연속 제어 벤치마크와 실제 로봇의 유연한 물체 조작 작업에서 최신 기술 수준의 성능을 달성하며, 명시적 제약 조건(예: KL 또는 MMD)이 없는 방법보다 뛰어나고, 외부 분포를 제어할 수 있는 변형층을 통해 외부 분포 일반화를 가능하게 한다.

ABSTRACT

The goal of offline reinforcement learning is to learn a policy from a fixed dataset, without further interactions with the environment. This setting will be an increasingly more important paradigm for real-world applications of reinforcement learning such as robotics, in which data collection is slow and potentially dangerous. Existing off-policy algorithms have limited performance on static datasets due to extrapolation errors from out-of-distribution actions. This leads to the challenge of constraining the policy to select actions within the support of the dataset during training. We propose to simply learn the Policy in the Latent Action Space (PLAS) such that this requirement is naturally satisfied. We evaluate our method on continuous control benchmarks in simulation and a deformable object manipulation task with a physical robot. We demonstrate that our method provides competitive performance consistently across various continuous control tasks and different types of datasets, outperforming existing offline reinforcement learning methods with explicit constraints. Videos and code are available at https://sites.google.com/view/latent-policy.

연구 동기 및 목표

  • 외부 분포 행동으로 인한 외삽 오차 문제를 해결하기 위해.
  • 데이터셋의 지지역역 내에 액션을 암묵적으로 제약하는 방법을 개발하여, KL 또는 MMD와 같은 명시적 산란 제약 조건에 의존하지 않도록 하기 위해.
  • 데이터셋 내에서의 일반화를 가능하게 하면서도, Q함수가 잘 일반화될 경우 외부 분포 행동 선택을 제어 가능하게 하기 위해.
  • 실제 로봇 조작 작업을 포함한 다양한 데이터셋과 환경에서 일관된 성능을 보여주기 위해.

제안 방법

  • 정적 데이터셋에서 행동 정책의 액션 분포를 모델링하기 위해 조건부 Variational Autoencoder(CVAE)를 훈련한다.
  • CVAE의 잠재 공간에서 정책을 학습시켜, 구성상 생성된 모든 액션이 데이터셋의 지지역역 내에 있도록 보장한다.
  • 환경 상호작용을 위해 CVAE 디코더를 사용해 잠재 액션을 원래 액션 공간으로 매핑한다.
  • Q함수가 잘 일반화될 경우 외부 분포 행동의 제어 가능한 탐색을 가능하게 하는 변형층을 도입한다.
  • 잠재 액션 정책를 사용해 오프라인 강화학습 목표(예: TD 학습)를 최적화하며, 액션 분포에 대한 명시적 정규화를 회피한다.
  • 내부 분포 일반화(잠재 공간을 통한)와 외부 분포 일반화(변형층을 통한)를 분리하여 세밀한 제어를 가능하게 한다.

실험 결과

연구 질문

  • RQ1학습된 잠재 행동 공간에서 정책을 훈련시켜 데이터셋의 액션 지지역역에 암묵적으로 제약을 둘 수 있는가? 이는 명시적 산란 제약 조건이 필요 없음을 의미한다.
  • RQ2BEAR, BCQ, BRAC와 같은 명시적 제약 조건이 있는 기존 오프라인 강화학습 방법과 비교해 PLAS의 성능은 어떻게 되는가? 다양한 데이터셋에서의 성능을 비교한다.
  • RQ3어떤 상황에서 변형층을 통해 외부 분포 행동을 허용함으로써 성능 향상이 이루어지며, 변형 크기는 어떻게 조정해야 하는가?
  • RQ4PLAS는 오프라인 데이터만을 사용해 실제 세계의 로봇 작업, 예를 들어 유연한 물체 조작에 효과적으로 일반화할 수 있는가?

주요 결과

  • PLAS는 다양한 데이터셋에서 d4rl 연속 제어 벤치마크에서 BEAR, BCQ, BRAC와 같은 기존 오프라인 강화학습 방법을 모두 능가한다.
  • Walker2d-medium 데이터셋에서, 변형 없이 44.6의 정규화 점수를 기록했고, ε=0.1일 경우 66.9로 훨씬 뛰어난 성능을 보였다.
  • Q함수 추정에서 일관되게 낮은 평균 제곱 오차(MSE)를 기록하여, BEAR 및 BRAC보다 더 높은 전반적인 Q값 정확도를 확보했다.
  • Q함수 예측에서 과대평가 또는 과소평가 편향이 최소화되었으며, 상태-액션 쌍 전반에 걸쳐 균형 잡힌 오차 분포를 보였다.
  • 변형층은 랜덤 데이터셋(예: Hopper-random 점수는 ε=0.5일 경우 10.5에서 13.3으로 상승)에서 성능 향상을 이끌었지만, medium-expert 및 medium-replay 데이터셋에서는 성능 저하를 초래했다.
  • 실제 로봇 실험에서, PLAS는 오프라인 데이터만을 사용해 유연한 물체 조작를 위한 정책을 성공적으로 학습시켰으며, 실용적 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.