[논문 리뷰] Skill-based Model-based Reinforcement Learning
이 논문은 기술 기반 모델 기반 강화 학습 프레임워크인 SkiMo를 제안한다. 이는 정확한 장기 예측과 장기 계획을 가능하게 하기 위해 기술 동역학 모델을 학습하며, 기존의 모델 기반 및 기술 기반 강화 학습 방법에 비해 장기 예상 보상 태스크 및 장기 예측이 필요한 탐색 및 조작 작업에서 샘플 효율성과 성능을 크게 향상시킨다.
Model-based reinforcement learning (RL) is a sample-efficient way of learning complex behaviors by leveraging a learned single-step dynamics model to plan actions in imagination. However, planning every action for long-horizon tasks is not practical, akin to a human planning out every muscle movement. Instead, humans efficiently plan with high-level skills to solve complex tasks. From this intuition, we propose a Skill-based Model-based RL framework (SkiMo) that enables planning in the skill space using a skill dynamics model, which directly predicts the skill outcomes, rather than predicting all small details in the intermediate states, step by step. For accurate and efficient long-term planning, we jointly learn the skill dynamics model and a skill repertoire from prior experience. We then harness the learned skill dynamics model to accurately simulate and plan over long horizons in the skill space, which enables efficient downstream learning of long-horizon, sparse reward tasks. Experimental results in navigation and manipulation domains show that SkiMo extends the temporal horizon of model-based approaches and improves the sample efficiency for both model-based RL and skill-based RL. Code and videos are available at https://clvrai.com/skimo
연구 동기 및 목표
- 오차 누적이 심하고 계산 비용이 높아지는 문제로 인해 기존의 모델 기반 강화 학습이 장기 예측 태스크에서 성능이 떨어지는 문제를 해결하기 위해.
- 일반적으로 수백만에서 수십억 개의 환경 상호작용이 필요한 기술 기반 강화 학습의 샘플 효율성을 향상시키기 위해.
- 중간 단계를 요약하는 기술 수준의 동역학 모델을 학습하여 정확한 장기 예측과 계획을 가능하게 하기 위해.
- 오프라인 데이터로부터 기술 레파지토리와 기술 동역학 모델을 동시에 학습하여 계획 신뢰도와 후속 정책 학습 성능을 향상시키기 위해.
제안 방법
- 대규모 오프라인 데이터셋을 사용하여 기술 동역학 모델과 기술 레파지토리를 동시에 학습시켜 예측 가능하고 실행 가능한 기술 임베딩 공간을 형성한다.
- 시뮬레이션된 트레이젝터리에서 분리된, 해석 가능한 기술 임베딩을 학습하기 위해 변동성 오토인코더(Variational Autoencoder, VAE)를 사용한다.
- 단계별 동역학 예측을 대체로 기술 실행 후의 결과 상태를 직접 예측함으로써 오차 누적를 줄인다.
- 학습된 기술 동역학 모델을 CEM 및 MPPI와 같은 계획 알고리즘의 장기 예측을 위해 활용하여 고수준 정책 학습을 안내한다.
- SAC(Soft Actor-Critic)를 사용하여 기술 동역학 모델이 예측한 상상 속 미래 결과를 기반으로 기술을 선택하는 고수준 작업 정책을 학습한다.
- 커리큘럼 학습 및 커리큘럼 기반 탐색을 활용하여 후속 작업 학습 동안 샘플 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1기존의 단순 단계별 동역학 모델에 비해 기술 수준의 동역학 모델을 학습시키는 것이 장기 예측 오차를 줄이는가?
- RQ2기술 동역학 모델을 활용해 기술 공간에서 계획을 수행하면 장기 예측, 희박 보상 태스크에서 샘플 효율성이 향상되는가?
- RQ3기술과 기술 동역학 모델을 동시에 학습시키는 것이 후속 정책 성능과 계획 정확도에 어떤 영향을 미치는가?
- RQ4기본 기술 동역학 모델은 표준 모델 기반 기준 대비 더 신뢰할 수 있는 장기 예측을 가능하게 하는가?
주요 결과
- SkiMo는 희박 보상이 주어지는 장기 예측 태스크인 탐색 및 조작 작업에서 최신 기술 기반 및 모델 기반 강화 학습 방법보다 뛰어난 성능을 보였다.
- 기술 동역학 모델은 장기 예측에서 오차 누적를 줄여, 실제 값에서 최소한의 편차로 500단계 이상의 정확한 궤적 시뮬레이션을 가능하게 하였다.
- 기술 동역학 모델과 기술 레파지토리를 동시에 학습시키는 것은 특히 Maze 및 CALVIN과 같은 복잡한 환경에서 더 빠르고 안정적인 학습을 이끌어냈다.
- CEM 계획법을 기술 동역학 모델과 함께 사용하면 Kitchen 및 CALVIN 태스크에서 샘플 효율성과 최종 성능이 크게 향상되었다.
- SkiMo는 LSP 및 DADS와 같은 기준 방법보다 더 빠른 학습 속도를 보였으며, 특히 장거리 추론이 필요한 환경에서 두드러졌다.
- 제거 실험 결과, 기술 동역학 모델이 장기 예측 성능을 확보하는 데 필수적임을 확인하였으며, 단일 단계 동역학 모델로 대체할 경우 계획 및 학습 성능이 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.