[논문 리뷰] Offline Reinforcement Learning from Images with Latent Space Models
LOMPO는 이미지 데이터에서 시각운동 정책을 학습하기 위해 변동형 오토인코더를 훈련하고, 앙상블 형태의 잠재 동역학 모델을 사용하는 잠재 공간 모델 기반 오프라인 강화학습 알고리즘을 제안한다. 이는 잠재 공간 내에서 모델 간 이견을 통해 불확실성을 정량화하고, 이러한 불확실성에 기반해 보상을 페널티 처리하며, 불확실성 정규화된 MDP에서 낙관주의를 배제한 방식으로 정책을 최적화함으로써, 환경 상호작용 없이도 이미지 기반 이동 및 조작 과제에서 최신 기술 수준의 성능을 달성한다.
Offline reinforcement learning (RL) refers to the problem of learning policies from a static dataset of environment interactions. Offline RL enables extensive use and re-use of historical datasets, while also alleviating safety concerns associated with online exploration, thereby expanding the real-world applicability of RL. Most prior work in offline RL has focused on tasks with compact state representations. However, the ability to learn directly from rich observation spaces like images is critical for real-world applications such as robotics. In this work, we build on recent advances in model-based algorithms for offline RL, and extend them to high-dimensional visual observation spaces. Model-based offline RL algorithms have achieved state of the art results in state based tasks and have strong theoretical guarantees. However, they rely crucially on the ability to quantify uncertainty in the model predictions, which is particularly challenging with image observations. To overcome this challenge, we propose to learn a latent-state dynamics model, and represent the uncertainty in the latent space. Our approach is both tractable in practice and corresponds to maximizing a lower bound of the ELBO in the unknown POMDP. In experiments on a range of challenging image-based locomotion and manipulation tasks, we find that our algorithm significantly outperforms previous offline model-free RL methods as well as state-of-the-art online visual model-based RL methods. Moreover, we also find that our approach excels on an image-based drawer closing task on a real robot using a pre-existing dataset. All results including videos can be found online at https://sites.google.com/view/lompo/ .
연구 동기 및 목표
- 환경 상호작용 없이 정적이고 사전 수집된 이미지 데이터셋에서 안전하고 샘플 효율적인 시각운동 정책 학습을 가능하게 하기 위해.
- 고차원 시각적 동역학 모델에서의 불확실성 정량화 문제를 해결하기 위해, 픽셀 공간에서의 계산이 비효율적인 문제를 해결하기 위해.
- 학습된 잠재 공간 내에서의 불확실성을 활용하여 이미지 기반 제어에서 일반화 능력과 분포 이탈에 대한 강건성을 향상시키기 위해.
- 원시 관측값에서 오프라인 강화학습을 수행할 수 있는 계산적으로 타당하면서도 이론적으로 탄탄한 방법을 개발하여 낙관주의를 유지하고 모델 오용을 방지하기 위해.
- 기존의 모델 프리 또는 온라인 시각 기반 모델 기반 강화학습 방법보다 이미지 기반 제어 벤치마크에서 슈퍼리어한 성능을 달성하기 위해.
제안 방법
- 이미지 시퀀스에서 분리된 잠재 표현을 학습하기 위해, 컨volutional 인코더, 공유된 결정론적 전이 모델(GRU), 그리고 확률적 전이 모델(MLP)을 사용한 변동형 오토인코더를 훈련한다.
- 각 모델가 동일한 결정론적 전이를 공유하지만 독립적인 확률적 구성요소를 가진 잠재 동역학 모델의 앙상블을 구성한다.
- 추론 모델을 사용해 관측된 이미지 시퀀스에서 잠재 상태를 사후 샘플링함으로써, 잠재 공간 내에서 전이 모델링을 가능하게 한다.
- 정책에서 액션을 샘플링하고 확률적 동역학 모델을 사용해 전이를 예측함으로써, 잠재 공간에서의 합성 롤아웃을 생성한다.
- 잠재 공간 내에서 앙상블 모델 간 이견에 기반해 페널티가 부여된 보상을 계산하며, 이는 분포 이탈을 방지하기 위한 낙관주의 정규화 기법으로 기능한다.
- 실제 전이와 합성 잠재 전이를 포함한 복합 리play 버퍼를 사용해 오프-폴리시 알고리즘(예: SAC)을 통해 정책을 최적화하며, 불확실성 페널티가 부여된 수익을 사용한다.
실험 결과
연구 질문
- RQ1상태 표현이 제공되지 않는 이미지 기반 제어 과제에 대해 오프라인 모델 기반 강화학습이 효과적으로 적용될 수 있는가?
- RQ2픽셀 공간에서 직접 불확실성 추정을 수행하는 것에 비해, 잠재 공간 내에서의 불확실성 정량화가 계산적으로 타당하고 효과적인 대안이 될 수 있는가?
- RQ3잠재 동역학 모델의 앙상블 이견이 불확실성의 신뢰할 수 있는 대체 지표로 작용하여 오프라인 강화학습에서 일반화 능력과 안전성을 향상시킬 수 있는가?
- RQ4잠재 공간에서 페널티가 부과된 MDP에서 학습하는 것이 기존의 모델 프리 또는 온라인 모델 기반 방법보다 이미지 기반 벤치마크에서 더 높은 성능을 내는가?
- RQ5제안된 방법이 시각 기반 제어에서 다중 작업 및 분포 외 상태 설정으로 일반화 가능한가?
주요 결과
- LOMPO는 DeepMind Control, D’Claw Screw, Adroit Pen, Door Open 환경를 포함한 이미지 기반 이동 및 조작 과제에서 최신 기술 수준의 모델 프리 오프라인 강화학습 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 환경 상호작용 없이 오프라인 데이터에서만 훈련되었음에도 불구하고, DreamerV2와 같은 온라인 시각 기반 모델 기반 강화학습 방법과 비교해 유사하거나 뛰어난 성능을 달성했다.
- 분포 이탈, 특히 분포 외 상태와 조명 변화에 대해 강건성을 보이며 일반화 능력이 뛰어나다는 것을 입증했다.
- 앙상블 이견을 통한 잠재 공간 내 불확실성 활용은 과적합과 모델 오용을 방지하는 낙관주의 정규화 효과를 유도했다.
- LOMPO는 이미지 기반 제어 과제 전반에서 높은 샘플 효율성과 안정성을 확보했으며, 실제 로봇 조작 과제도 포함하여 성능을 입증했다.
- 아블레이션 연구 결과, 불확실성 페널티와 잠재 동역학의 사용이 성능 향상에 핵심적임을 확인했으며, 불확실성 모델링을 제거할 경우 성능 저하가 심각하게 발생했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.