[논문 리뷰] Discovering and Achieving Goals via World Models
LEXA는 학습된 세계 모델을 사용하여 상상 속에서 별도의 탐색자 및 성취자 정책을 훈련하는 비지도 강화학습 에이전트이다. 새로운 정보 수익이 높은 상태를 사전 계획함으로써, 보상이나 지도 없이 다양성을 갖춘 목표를 탐지하고 목표 이미지에서 제로샷으로 이를 달성한다. 이는 조작 및 이동 환경을 포함한 다양한 과제를 포함하는 새로운 40개 과제 벤치마크에서 이전 방법들을 능가한다.
How can artificial agents learn to solve many diverse tasks in complex visual environments in the absence of any supervision? We decompose this question into two problems: discovering new goals and learning to reliably achieve them. We introduce Latent Explorer Achiever (LEXA), a unified solution to these that learns a world model from image inputs and uses it to train an explorer and an achiever policy from imagined rollouts. Unlike prior methods that explore by reaching previously visited states, the explorer plans to discover unseen surprising states through foresight, which are then used as diverse targets for the achiever to practice. After the unsupervised phase, LEXA solves tasks specified as goal images zero-shot without any additional learning. LEXA substantially outperforms previous approaches to unsupervised goal-reaching, both on prior benchmarks and on a new challenging benchmark with a total of 40 test tasks spanning across four standard robotic manipulation and locomotion domains. LEXA further achieves goals that require interacting with multiple objects in sequence. Finally, to demonstrate the scalability and generality of LEXA, we train a single general agent across four distinct environments. Code and videos at https://orybkin.github.io/lexa/
연구 동기 및 목표
- 인간의 감독 없이 복잡한 시각 환경에서 다양한 기술을 학습할 수 있도록 하는 것.
- 비지도 목표 조건 강화학습에서 효율적 탐색의 과제를 해결하는 것.
- 비지도 사전 훈련 이후 사용자 지정 목표 이미지에 대해 제로샷 일반화를 가능하게 하는 것.
- 원시 시각 입력에서 복잡한 조작 및 이동 행동을 학습하기 위한 확장 가능한 프레임워크를 개발하는 것.
- 비지도 목표도달 에이전트 평가를 위해 40개의 다양한 과제를 포함하는 새로운 벤치마크를 도입하는 것.
제안 방법
- LEXA는 변분 오토인코더와 역학 모델을 사용해 원시 이미지 관측에서 세계 모델을 학습한다.
- 탐색자 정책은 세계 모델에 대한 기대 정보 수익을 최대화함으로써 상상 속에서 새로운, 높은 정보 수익 상태를 계획한다.
- 발견된 상태는 세계 모델 내에서 온정책 롤아웃을 통해 성취자 정책을 훈련하기 위한 다양한 목표로 사용된다.
- 성취자 정책은 경험 재라벨링을 피하고 상상된 궤적을 활용함으로써 전망 기반 롤아웃을 사용해 훈련된다.
- 학습된 거리 함수는 상태와 목표 사이의 도달 가능성 비용을 측정하며, 온정책 경험을 사용해 상상 속에서 최적화된다.
- 이 프레임워크는 보상 조정이나 추가 학습 없이도 테스트 시에 목표 이미지만으로 제로샷 목표 달성을 가능하게 한다.
실험 결과
연구 질문
- RQ1보상이나 감독 없이도, 복잡한 시각 환경에서 의미 있는, 볼 수 없는 목표를 탐지할 수 있는가?
- RQ2학습된 세계 모델에서 전망 기반 계획이 이전 방법에 비해 탐색 효율성을 크게 향상시킬 수 있는가?
- RQ3단일 사전 훈련된 성취자 정책이 훈련 중에 볼 수 없었던 다양한 사용자 지정 목표 이미지에 대해 추가 미세조정 없이 제로샷 일반화가 가능한가?
- RQ4비지도 세계 모델 기반 훈련이 복잡한 다중 물체 조작 및 이동 과제에서 성공을 이끌 수 있는가?
- RQ5LEXA의 성능는 도전적이고 다양한 벤치마크에서 이전의 비지도 목표도달 방법과 비교해 어떻게 되는가?
주요 결과
- LEXA는 이전 비지도 목표도달 벤치마크에서 최고 성능을 기록하며 이전 방법들보다 뚜렷이 뛰어나다.
- LEXA는 도전적인 다중 물체 조작 벤치마크인 RoboKitchen 환경에서 과제를 성공적으로 해결한 최초의 에이전트이다.
- LEXA는 로봇 조작 및 이동 도메인 4개에 걸쳐 40개의 다양한 테스트 과제에서 성공을 거두었으며, 다수의 물체에 대한 복잡한 순차적 상호작용도 수행한다.
- 상상 기반 탐색을 사용함으로써, 이전 방법들이 리레코일 버퍼 상태나 생성 모델에 의존하는 것보다 더 다양하고 효과적인 목표 탐지가 가능하다.
- 성취자 정책은 훈련 중에 볼 수 없었던 목표 이미지에 대해 보상 조정이나 미세조정 없이 제로샷 일반화가 가능하다.
- LEXA의 성능는 고차원 제어 과제에서 뛰어나며, RoboYoga의 정밀 제어나 RoboBins의 다중 물체 조작 과제에서도 견고하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.