[논문 리뷰] Reset-Free Lifelong Learning with Skill-Space Planning
이 논문은 비정적이고 비에피소드적 환경에서 안정적이고 지속적인 학습을 가능하게 하는 리셋이 없는 종신 강화학습 프레임워크인 종신 스킬 계획(LiSP)을 제안한다. LiSP는 스킬 공간에서의 비지도 스킬 발견과 장기 예측 계획을 활용하여, 환경 리셋 없이도 치명적인 기억 상실을 줄이고 장기 예측 추론을 효과적으로 수행한다. 기존 방법에 비해 모델리스 스킬 학습과 모델기반 계획을 결합함으로써 뛰어난 성능을 달성한다.
The objective of lifelong reinforcement learning (RL) is to optimize agents which can continuously adapt and interact in changing environments. However, current RL approaches fail drastically when environments are non-stationary and interactions are non-episodic. We propose Lifelong Skill Planning (LiSP), an algorithmic framework for non-episodic lifelong RL based on planning in an abstract space of higher-order skills. We learn the skills in an unsupervised manner using intrinsic rewards and plan over the learned skills using a learned dynamics model. Moreover, our framework permits skill discovery even from offline data, thereby reducing the need for excessive real-world interactions. We demonstrate empirically that LiSP successfully enables long-horizon planning and learns agents that can avoid catastrophic failures even in challenging non-stationary and non-episodic environments derived from gridworld and MuJoCo benchmarks.
연구 동기 및 목표
- 침수 상태로 인해 치명적인 실패가 발생하는 비에피소드적, 비정적 환경에서 현재 강화학습 알고리즘의 불안정성 해결.
- 환경 리셋 없이 작동하는 종신 강화학습 프레임워크 개발으로 실제 세계의 지속적 학습을 모방.
- 비용이 많이 드는 실제 세계 상호작용에 의존도를 줄이기 위해 온라인 및 오프라인 데이터로부터 스킬 발견 및 계획 기능 제공.
- 단기 예측 계획의 한계와 모델 정확도 문제를 해결하기 위해 행동을 제약하고 계획의 안정성을 향상시키는 추상적 스킬 공간에서의 운영
제안 방법
- 내재 보상과 역학 인식 스킬 발견 방법(DADS)을 활용해 비지도 방식으로 고차원 스킬을 학습하고, 스킬 연습 제안 분포를 추가로 적용.
- 스킬 공간에 대한 학습된 역학 모델을 구축하여 모델기반 계획 알고리즘을 사용해 장기 예측 계획을 수행.
- 불확실성 추정과 오프라인 스킬 학습 중 보상 형성 향상을 위해 역학 모델의 확률적 앙상블을 사용.
- 모델리스 정책 네트워크를 통합해 스킬을 실행하고, 스킬 공간에서의 의사결정을 위해 모델기반 계획과 융합.
- 기준 비교를 위해 액션 공간에서의 모델 예측 제어(MPC)를 적용하며, 장기(H=180) 및 단기(H=25) 예측 수준을 모두 사용.
- 비정적 역학과 다중 작업, 비에피소드적 설정을 갖춘 수정된 그리드월드 및 MuJoCo 벤치마크에서 학습 및 평가 수행.
실험 결과
연구 질문
- RQ1표준 강화학습이 실패하는 리셋이 없는 비정적 환경에서 스킬 공간 계획이 안정적이고 장기 예측 의사결정을 가능하게 하는가?
- RQ2환경 리셋이 없는 조건에서 LiSP가 오프라인 데이터로부터 스킬을 얼마나 효과적으로 학습하는가?
- RQ3액션 공간에서의 단기 예측 계획에 비해 스킬 공간에서의 장기 예측 계획은 어떤 영향을 미치는가?
- RQ4스킬 연습 제안 분포의 사용이 비에피소드적 환경에서 스킬 학습에 어떤 영향을 미치는가?
- RQ5수동 리셋에 의존하지 않고도 침수 상태가 존재하는 환경에서 LiSP가 치명적인 실패를 얼마나 효과적으로 방지할 수 있는가?
주요 결과
- LiSP는 리셋이 없는 비에피소드적 환경에서 표준 모델리스 강화학습 알고리즘(SAC, MBPO)보다 뛰어난 성능을 보이며, 리셋이 없는 조건에서 관찰된 치명적인 실패를 피한다.
- 종신 허퍼 벤치마크에서 LiSP는 평균 수익으로서 0.84 ± 0.02(빠름), 0.88 ± 0.05(느림), 0.81 ± 0.01(뒤로), MPC-Long(0.27–0.49) 및 MPC-Short(0.27–0.32)를 크게 초월한다.
- LiSP는 오프라인 데이터로부터 단일 스킬 세트를 학습하여 허퍼 환경에서 다양한 목표 속도로 일반화 성능을 달성함으로써 효과적인 오프라인 종신 학습을 입증한다.
- 절단 실험 결과, 장기 예측 계획이 스킬 공간에서 필수적임을 확인하였으며, 단기 예측 MPC 기준은 안정된 성능을 달성하지 못한다.
- 리셋이 없는 설정에서 스킬 연습 제안 분포가 학습 신호를 크게 증폭시켜 스킬 발견의 안정성을 향상시킨다.
- LiSP는 다양한 비정적, 다중 작업 환경에서 뛰어난 성능 유지를 보이며, 실제 세계 유사 종신 학습 시나리오에서의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.