[논문 리뷰] Latent Plans for Task-Agnostic Offline Reinforcement Learning
이 논문은 비정형 플레이 데이터에서 잠재 스킬을 탐지하기 위한 이mitation learning과 고수준 스킬 체이닝을 위한 오프라인 강화학습을 결합한 계층적 오프라인 강화학습 프레임워크인 TACO-RL을 제안한다. 이를 통해 작업에 종속되지 않고 장기적인 로봇 제어를 가능하게 한다. 원격 조작 시범 데이터에서 잠재 계획을 학습하고, 후회 기반 재라벨링을 사용해 목표 조건이 부여된 고수준 정책을 훈련시킴으로써 TACO-RL은 시뮬레이션과 실제 환경의 조작 작업에서 최신 기준보다 최대 한 계단 차수 성능 향상을 달성하였으며, 단일 7-DoF 정책이 25개의 다양한 실제 작업을 해결할 수 있다.
Everyday tasks of long-horizon and comprising a sequence of multiple implicit subtasks still impose a major challenge in offline robot control. While a number of prior methods aimed to address this setting with variants of imitation and offline reinforcement learning, the learned behavior is typically narrow and often struggles to reach configurable long-horizon goals. As both paradigms have complementary strengths and weaknesses, we propose a novel hierarchical approach that combines the strengths of both methods to learn task-agnostic long-horizon policies from high-dimensional camera observations. Concretely, we combine a low-level policy that learns latent skills via imitation learning and a high-level policy learned from offline reinforcement learning for skill-chaining the latent behavior priors. Experiments in various simulated and real robot control tasks show that our formulation enables producing previously unseen combinations of skills to reach temporally extended goals by "stitching" together latent skills through goal chaining with an order-of-magnitude improvement in performance upon state-of-the-art baselines. We even learn one multi-task visuomotor policy for 25 distinct manipulation tasks in the real world which outperforms both imitation learning and offline reinforcement learning techniques.
연구 동기 및 목표
- 고차원 시각적 관측에서 오프라인 강화학습을 통해 장기적인, 작업에 종속되지 않는 정책을 학습하는 데 도전한다.
- 장기적인 시간 간격과 고차원 상태 공간에서 어려움을 겪는 기존 오프라인 RL 방법의 한계를 극복한다.
- 사전에 정의된 작업 없이 원격 조작를 통해 수집된 비정형 플레이 데이터를 활용해 자기지도적 이mitation learning을 통해 재사용 가능한 잠재 스킬을 탐지한다.
- 학습된 잠재 행동을 고수준 목표 조건 정책을 통해 체이닝함으로써 새로운 목표 상태와 복잡한 순차 작업에 일반화할 수 있도록 한다.
- 시뮬레이션과 실제 환경의 로봇 조작 작업에서 단독 이mitation learning 및 오프라인 RL 기준보다 뛰어난 성능을 달성한다.
제안 방법
- 비정형 원격 조작 플레이 데이터를 활용해, 이mitation learning을 통해 잠재 계획에서 동작으로의 매핑을 수행하는 저수준 정책을 사전 훈련한다.
- 고수준 정책이 잠재 계획 공간에서 작동하고, 이산적 또는 연속적인 잠재 스킬을 출력하여 저수준 정책에서 디코딩하도록 계층적 정책을 학습한다.
- 후회 기반 경험 재생(HER)을 사용해 오프라인 강화학습을 통해 고수준 정책을 훈련함으로써 전이를 재라벨링하고 샘플 효율성을 향상시킨다.
- 목표 조건 형식을 사용해 고수준 정책이 목표 상태에 도달하기 위한 잠재 계획을 예측함으로써 강화학습 문제의 효과적 시간 간격을 줄인다.
- 샘플 효율성 향상과 비최적 또는 부분 최적 궤적에서의 학습을 가능하게 하기 위해 오프라인 데이터셋에 후회 기반 재라벨링을 통합한다.
- 실제 구현에서의 가시성 부족 문제를 줄이고 시각적 기반을 향상시키기 위해 괈이-카메라 RGB 이미지를 추가 입력으로 통합한다.
실험 결과
연구 질문
- RQ1비정형 플레이 데이터에서 효과적으로 작업에 종속되지 않고 장기적인 정책을 학습할 수 있는 계층적 오프라인 RL 프레임워크는 가능한가?
- RQ2잠재 스킬 탐지에 대한 이mitation learning과 스킬 체이닝을 위한 오프라인 RL을 조합하면 장기적인 작업에서 최신 기준 이mitation learning 및 오프라인 RL 방법을 초월할 수 있는가?
- RQ3모델은 시뮬레이션과 실제 세계에서 새로운 목표 상태와 복잡한 순차 조작 작업에 얼마나 잘 일반화되는가?
- RQ4후회 기반 재라벨링의 사용이 고수준 정책 훈련의 샘플 효율성과 성능 향상에 얼마나 기여하는가?
- RQ5단일 다중 작업 시각 운동 정책을 비정형 플레이 데이터만으로 사용해 다양한 장기적인 조작 작업을 해결할 수 있는가?
주요 결과
- TACO-RL은 실제 환경의 25개 조작 작업 평균 성공률 61%를 기록하여, LMP(40%) 및 CQL+HER(11%) 기준보다 뚜렷이 뛰어난 성능을 보였다.
- 실제 실험에서 TACO-RL은 '서랍 닫기' 작업에서 90%의 성공률, '슬라이더 왼쪽으로 이동' 작업에서 75%의 성공률을 기록하여 기준보다 큰 격차로 승리했다.
- 모델는 강력한 제로샷 일반화 능력을 보였으며, 단일 목표 이미지만을 사용해도 블록 쌓기 및 먼 거리로 블록 이동과 같은 복잡한 순차 작업을 성공적으로 수행했다.
- 시뮬레이션 환경에서 TACO-RL은 장기적인 작업에서 최신 기준 기준보다 최대 한 계단 차수의 성능 향상을 보였다.
- 특히 다단계 또는 장기적인 계획이 필요한 상황에서 새로운 목표 이미지에 효과적으로 일반화되었다.
- 후회 기반 재라벨링과 잠재 계획 표현의 사용 덕분에, 원래 데이터셋에 비최적 또는 목표를 향한 방향이 없는 궤적들이 포함되어 있더라도 효과적인 스킬 체이닝이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.