[논문 리뷰] Disentangled Skill Embeddings for Reinforcement Learning
이 논문은 다중 작업 강화 학습에서 역동성과 목표에 대해 별개의 잠재 표현을 학습함으로써, 새로운 조합으로의 빠른 일반화를 가능하게 하는 변분 추론 기반 프레임워크인 분리된 스킬 임베딩(DSE)을 제안한다. 이 방법은 Reacher 및 CartPole와 같은 MuJoCo 작업에서 단일 임베딩 및 독립 기준선보다 뛰어난 전이 및 재학습 성능을 달성한다.
We propose a novel framework for multi-task reinforcement learning (MTRL). Using a variational inference formulation, we learn policies that generalize across both changing dynamics and goals. The resulting policies are parametrized by shared parameters that allow for transfer between different dynamics and goal conditions, and by task-specific latent-space embeddings that allow for specialization to particular tasks. We show how the latent-spaces enable generalization to unseen dynamics and goals conditions. Additionally, policies equipped with such embeddings serve as a space of skills (or options) for hierarchical reinforcement learning. Since we can change task dynamics and goals independently, we name our framework Disentangled Skill Embeddings (DSE).
연구 동기 및 목표
- 다중 작업 강화 학습에서 변화하는 작업 역동성과 보상 함수에 대한 정책의 일반화 문제를 해결한다.
- 기존 방법에서 잠재 공간이 뒤섞여 있어 새로운 작업 조합으로의 일반화를 방해하는 한계를 극복한다.
- 역동성과 목표에 대해 분리된, 작업별로 특화된 잠재 표현을 학습함으로써 효율적인 전이와 빠른 재학습을 가능하게 한다.
- 고수준 정책 학습을 위한 재사용 가능하고 분리된 스킬 공간을 제공함으로써 계층적 강화 학습을 촉진한다.
- 제로샷 및 소수의 샘플을 통한 재학습 시나리오를 통해 새로운 역동성과 목표 조건으로의 일반화를 입증한다.
제안 방법
- 공통된 정책 파라미터와 함께 두 개의 분리된 잠재 변수(역동성(z)과 목표(g))를 가진 변분 추론 문제로 다중 작업 강화 학습을 공식화한다.
- 정책을 qϕ(π|z,g)로 매개변수화하며, z와 g는 작업별 분포에서 독립적으로 샘플링된다.
- 기대 수익을 최대화하고 사전 분포와 사후 분포 간의 KL 발산을 최소화하는 변분 목표를 사용해 훈련한다.
- 두 가지 알고리즘을 구현한다: 온폴리시 학습을 위한 DSE-REINFORCE와 오프폴리시, 소프트 액터-크리틱 스타일 학습을 위한 DSE-SAC.
- 잠재 공간을 분리하여 역동성 또는 목표 조건의 변화를 독립적으로 제어할 수 있도록 하여, 보간 및 제로샷 일반화를 가능하게 한다.
- 고수준 정책의 이산 행동 공간으로 목표 임베딩 공간을 사용함으로써 계층적 강화 학습을 가능하게 하며, DSE 정책를 저수준 옵션으로 활용한다.
실험 결과
연구 질문
- RQ1역동성과 목표에 대해 분리된 잠재 표현이 다중 작업 강화 학습에서 일반화를 향상시키는가?
- RQ2빠른 재학습 후, 분리된 임베딩을 가진 정책이 새로운 역동성과 목표 조합으로의 일반화 성능가 얼마나 우수한가?
- RQ3분리된 스킬 공간이 계층적 강화 학습에서 샘플 효율성을 얼마나 향상시키는가?
- RQ4다중 작업 및 소수 샘플 설정에서, 분리된 구조가 뒤섞인 또는 단일 임베딩 기준선보다 우수한가?
- RQ5학습된 임베딩이 새로운 목표 경로를 가진 계층적 강화 학습 시나리오에서 효과적인 고수준 정책 학습을 지원할 수 있는가?
주요 결과
- DSE-SAC은 Reacher-v2 환경에서 새로운 테스트 작업에서 평균 에피소드 보상 -21.96 ± 2.20을 기록했으며, 단일 임베딩 SAC(-24.29 ± 1.50)를 능가했다.
- 단일 작업 정책는 DSE-SAC의 초기 성능에 도달하기 위해 평균 43.22 ± 2.16개의 트레이젝터리를 필요로 하여 더 빠른 적응 능력을 보였다.
- DSE-SAC은 CartPole 및 Reacher 양쪽에서의 보간 실험을 통해 새로운 역동성과 목표 조합으로의 효과적인 일반화를 보였다.
- 계층적 강화 학습에서, DSE-SAC을 저수준 정책로 사용한 H-SAC은 저수준 행동으로 학습된 표준 SAC보다 연속적인 목표 추적 작업을 더 빨리 해결했다.
- DSE-REINFORCE는 CartPole에서 뛰어난 성능을 보였으며, DSE-SAC은 Reacher에서 DSE-REINFORCE를 능가하여 복잡한 환경에서 더 높은 샘플 효율성을 보였다.
- 분리된 구조는 역동성과 목표 조건를 독립적으로 제어할 수 있게 하여 효과적인 보간 및 제로샷 정책 전이를 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.