Skip to main content
QUICK REVIEW

[논문 리뷰] Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills

Yevgen Chebotar, Karol Hausman|arXiv (Cornell University)|2021. 04. 15.
Reinforcement Learning in Robotics참고 문헌 49인용 수 16
한 줄 요약

이 논문은 보상 없이 온라인 상호작용 없이도 오프라인 실세계 로봇 데이터에서 목표 조건화 정책을 학습하는 방법인 Actionable Models를 제안한다. 목표 조건화 Q-학습과 후회 레이블링, 그리고 합성 음성 행동 정규화를 사용함으로써, 새로운 작업에 대해 제로샷 일반화, 장기 환경 목표 체인, 그리고 이미지 관측치를 사용한 실제 로봇에서의 사전 훈련 또는 보조 목표를 통한 후속 강화학습에서의 성능 향상을 가능하게 한다.

ABSTRACT

We consider the problem of learning useful robotic skills from previously collected offline data without access to manually specified rewards or additional online exploration, a setting that is becoming increasingly important for scaling robot learning by reusing past robotic data. In particular, we propose the objective of learning a functional understanding of the environment by learning to reach any goal state in a given dataset. We employ goal-conditioned Q-learning with hindsight relabeling and develop several techniques that enable training in a particularly challenging offline setting. We find that our method can operate on high-dimensional camera images and learn a variety of skills on real robots that generalize to previously unseen scenes and objects. We also show that our method can learn to reach long-horizon goals across multiple episodes through goal chaining, and learn rich representations that can help with downstream tasks through pre-training or auxiliary objectives. The videos of our experiments can be found at https://actionable-models.github.io

연구 동기 및 목표

  • 수동 보상이나 온라인 탐색 없이 이전에 수집된 오프라인 데이터에서 다양한 로봇 기술을 학습하는 것을 목적으로 한다.
  • 모든 데이터셋 내 상태를 잠재적 목표로 간주함으로써 자동으로 다양한 작업을 합성하는 일반적인 목적 함수를 개발하는 것.
  • 미래의 행동에 대해 합성 음성 레이블을 사용하여 오프라인, 목표 조건화 강화학습 설정에서 훈련을 안정화시키는 것.
  • 여러 에피소드에 걸쳐 목표를 연결함으로써 장기 환경 기술 학습을 가능하게 하는 것.
  • 사전 훈련된 Actionable Models가 피니팅 또는 보조 목표를 통해 후속 작업 학습을 가속화할 수 있음을 보여주는 것.

제안 방법

  • 모든 데이터셋 내 목표 상태에 도달할 수 있는 정책을 훈련하기 위해 목표 조건화 Q-학습과 후회 레이블링을 사용한다.
  • 미래의 행동에 대해 낮은 Q-값을 할당하는 정규화 기법을 도입하여 오프라인 강화학습에서 분포 이탈과 과도한 추정을 완화한다.
  • 상태와 목표 모두에 이미지 기반 관측치를 사용함으로써 수동으로 설계된 보상 함수나 거리 측정 기준이 필요 없도록 한다.
  • 중간 목표를 웨이포인트로 삼아 여러 에피소드에 걸쳐 목표를 연결함으로써 장기 환경 기술 학습을 가능하게 한다.
  • 후속 작업 학습을 위한 사전 훈련 또는 보조 목표로 사전 훈련된 목표 조건화 정책을 활용한다.
  • 소량의 온라인 데이터와 작업에 특화된 보상으로 사전 훈련 모델을 피니팅하여 샘플 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1수동으로 지정된 보상 없이도 오프라인 실세계 로봇 데이터에서 목표 조건화 강화학습을 성공적으로 훈련시킬 수 있는가?
  • RQ2온라인 상호작용 없이 오프라인 목표 조건화 강화학습에서 분포 이탈과 과도한 추정을 어떻게 완화할 수 있는가?
  • RQ3단일 오프라인 데이터셋에서 다양한 일반화 가능한 기술을 하나의 모델이 학습할 수 있는가?
  • RQ4목표 체인을 통해 에피소드 수가 길어지고 데이터셋 내 가장 긴 궤적을 초월하는 목표에 도달할 수 있는가?
  • RQ5사전 훈련된 Actionable Models가 피니팅 또는 보조 목표를 통해 후속 작업 학습을 얼마나 빠르게 가속화할 수 있는가?

주요 결과

  • 사전 훈련된 모델을 사용해 10,000회 이내의 에피소드로 피니팅한 후, 세 가지 실세계 인스턴스 집게 작업에서 최소 20%의 성공률 달성. 반면 표준 오프라인 QT-Opt는 5% 미만의 성공률 기록.
  • 목표 도달 목표를 통한 사전 훈련이 시뮬레이션 및 실세계 환경 모두에서 후속 강화학습 훈련을 크게 가속화한다.
  • 온라인 훈련 중 보조 목표 도달 목표를 사용하면 표준 QT-Opt보다 학습 시간을 줄여 샘플 효율성을 향상시킨다.
  • 학습된 모델은 이전에 본 적 없는 장면과 물체로도 일반화되며, 시각적으로 제시된 목표에 대해 제로샷 일반화를 보여준다.
  • 목표 체인을 통해 여러 에피소드에 걸쳐 데이터셋의 세그먼트를 조합함으로써 장기 환경 목표에 도달할 수 있다.
  • Actionable Models에서 학습된 표현은 후속 작업에 대해 효과적인 특징으로 기능하며, 사전 훈련 또는 보조 목표로 사용할 경우 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.