Skip to main content
QUICK REVIEW

[논문 리뷰] Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation

Cansu Sancaktar, Sebastian Blaes|arXiv (Cornell University)|2022. 06. 22.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 다중 객체 조작 환경에서 샘플 효율적이고 궁금증 기반 탐색을 가능하게 하기 위해 그래프 신경망 앙상블을 활용한 구조적 월드 모델을 사용하는 CEE-US를 제안한다. 모델 간 이견을 통한 지식적 불확실성 감소를 계획함으로써 에이전트는 상호작용이 풍부한 행동을 보이며, 추가 훈련 없이도 스태킹, 뒤집기, 던지기와 같은 미사전 학습된 작업으로 제로샷 일반화를 달성한다.

ABSTRACT

It has been a long-standing dream to design artificial agents that explore their environment efficiently via intrinsic motivation, similar to how children perform curious free play. Despite recent advances in intrinsically motivated reinforcement learning (RL), sample-efficient exploration in object manipulation scenarios remains a significant challenge as most of the relevant information lies in the sparse agent-object and object-object interactions. In this paper, we propose to use structured world models to incorporate relational inductive biases in the control loop to achieve sample-efficient and interaction-rich exploration in compositional multi-object environments. By planning for future novelty inside structured world models, our method generates free-play behavior that starts to interact with objects early on and develops more complex behavior over time. Instead of using models only to compute intrinsic rewards, as commonly done, our method showcases that the self-reinforcing cycle between good models and good exploration also opens up another avenue: zero-shot generalization to downstream tasks via model-based planning. After the entirely intrinsic task-agnostic exploration phase, our method solves challenging downstream tasks such as stacking, flipping, pick & place, and throwing that generalizes to unseen numbers and arrangements of objects without any additional training.

연구 동기 및 목표

  • 내재적 궁금증을 사용하여 구성적 다중 객체 환경에서 샘플 효율적이고 상호작용이 풍부한 탐색을 가능하게 하기.
  • 기존 내재적 보상 방법이 희박한 조작 시나리오에서 정보적으로 유의미한 상호작용을 우선시하지 못하는 한계를 해결하기.
  • 그래프 신경망을 통한 관계적 인덕티브 바이어스를 활용하여 탐색 품질과 후속 작업 일반화를 향상시키기.
  • 다른 작업 수와 배치에 대해 유일한 내재적 탐색 단계만을 사용하여 제로샷 일반화를 입증하기.
  • 모델 기반 계획을 통해 모델 학습과 탐색 간 상호강화 사이클을 수립하기.

제안 방법

  • 에이전트는 객체를 노드로 모델링하고 상호작용 관계를 갖는 그래프 신경망(GNN) 앙상블을 사용하여 물체의 전방 동역학을 모델링한다.
  • GNN 앙상블 구성원 간의 이견을 통해 지식적 불확실성을 계산하여 내재적 궁금증 보상을 생성한다.
  • 온라인 계획 알고리즘은 구조적 월드 모델을 사용하여 향후 지식적 불확실성 감소를 최대화하는 행동을 선택한다.
  • 에이전트는 불확실성에 기반한 능동적 탐색을 통해 데이터를 수집하며, 이를 반복적으로 월드 모델을 정교화하는 데 사용한다.
  • 작업 무관 내재 단계 이후에 학습된 모델을 사용해 모델 기반 강화학습을 통해 후속 작업에 대해 제로샷 계획을 수행할 수 있다.
  • 이 방법은 이미지 관측이나 RND와 같은 별도의 내재 보상 모듈이 필요 없이 프опrioceptive 상태 관측만을 사용한다.

실험 결과

연구 질문

  • RQ1관계적 인덕티브 바이어스를 지닌 구조적 월드 모델이 다중 객체 조작에 대한 궁금증 기반 탐색에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2지식적 불확실성 감소를 계획함으로써 표준 내재 보상 방법에 비해 더 정보적이고 상호작용이 풍부한 탐색이 이루어지는가?
  • RQ3내재 궁금증 학습만으로도 다양한 후속 조작 작업, 특히 객체 수가 사전에 보지 않은 경우에도 제로샷 일반화가 가능한가?
  • RQ4GNN 앙상블 이견을 통한 불확실성 기반 탐색은 RND나 ICM과 같은 대안적 내재 보상 메커니즘보다 나은가?
  • RQ5내재 탐색 단계 이후에 모델 기반 계획이 후속 작업 성능 향상에 얼마나 기여하는가?

주요 결과

  • CEE-US는 RND나 ICM을 사용하는 베이스라인에 비해 후속 작업, 예를 들어 픽업 앤 플레이스, 스태킹, 플립, 던지기에서 유의미하게 높은 성공률을 기록한다.
  • 4개의 물체가 있는 픽업 앤 플레이스 작업에서 CEE-US는 RND 기반 대비 더 빨리 높은 성능에 도달하여 뛰어난 샘플 효율성을 보여준다.
  • 로보데스크 환경에서 서랍 열기 작업에서 성공률 0.97 ± 0.02, 슬라이딩 캐비닛 열기 작업에서 0.87 ± 0.07을 기록하여 강력한 제로샷 일반화 능력을 입증한다.
  • 공중에 있는 물체를 더 많이 수집함에도 불구하고 GNN + RND 변형은 CEE-US에 비해 성능이 열 劣하므로, 불확실성 기반 탐색이 더 유용한 데이터 수집을 이끈다는 것을 시사한다.
  • CEE-US는 상호작용 빈도와 후속 작업 성능 모두에서 MLP + iCEM 및 기타 베이스라인을 능가하며, 특히 복잡한 물체 조작이 필요한 작업에서 두각을 나타낸다.
  • 모델 학습과 탐색 간 상호강화 사이클은 외부 보상 신호 없이도 에이전트가 플립, 스태킹과 같은 복잡한 행동을 개발하도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.