Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Learning from Demonstrations and Unlabeled Experience

Konrad Żołna, Alexander Novikov|arXiv (Cornell University)|2020. 11. 27.
Reinforcement Learning in Robotics참고 문헌 43인용 수 14
한 줄 요약

이 논문은 보상 주석 없이도 전문가의 시범과 레이블이 없는 로봇 경험 데이터를 활용하여 오프라인 강화학습을 통해 높은 성능의 정책을 훈련시키는 오프라인 강화 이행 학습(ORIL)을 제안한다. 전문가 데이터와 레이블이 없는 데이터 간의 대조 학습을 통해 먼저 보상 함수를 학습한 후, 학습된 보상으로 모든 데이터를 재주석 처리함으로써 ORIL은 특히 제한된 시범 데이터와 증가하는 저품질의 레이블이 없는 데이터 상황에서 행동 복제(Behavior Cloning)를 일관되게 능가한다.

ABSTRACT

Behavior cloning (BC) is often practical for robot learning because it allows a policy to be trained offline without rewards, by supervised learning on expert demonstrations. However, BC does not effectively leverage what we will refer to as unlabeled experience: data of mixed and unknown quality without reward annotations. This unlabeled data can be generated by a variety of sources such as human teleoperation, scripted policies and other agents on the same robot. Towards data-driven offline robot learning that can use this unlabeled experience, we introduce Offline Reinforced Imitation Learning (ORIL). ORIL first learns a reward function by contrasting observations from demonstrator and unlabeled trajectories, then annotates all data with the learned reward, and finally trains an agent via offline reinforcement learning. Across a diverse set of continuous control and simulated robotic manipulation tasks, we show that ORIL consistently outperforms comparable BC agents by effectively leveraging unlabeled experience.

연구 동기 및 목표

  • 전체적으로 보상 주석이 없는 전문가의 시범과 레이블이 없는 경험 데이터만 이용 가능한 상황에서 오프라인 로봇 학습의 샘플 효율성 문제를 해결하기 위해.
  • 온라인 환경 상호작용 없이도 저품질 또는 혼합 품질의 레이블이 없는 데이터를 효과적으로 활용할 수 있는 정책 학습을 가능하게 하기 위해.
  • 레이블이 없는 데이터를 통해 보상 모델과 최종 정책를 동시에 훈련시킴으로써 행동 복제와 오프라인 강화학습의 장점을 융합하기 위해.
  • 고품질의 시범 데이터에 대한 의존도를 줄이기 위해, 저품질 또는 다양한 출처의 레이블이 없는 데이터에 대해 학습 과정이 강건하도록 하기 위해.
  • 시범 데이터가 부족한 상황에서도 잘 일반화되는 스케일러블하고 데이터 중심적인 접근법을 개발하기 위해.

제안 방법

  • 전문가 상태와 레이블이 없는 상태를 구분하는 대조 손실을 사용하여 보상 함수 $ R_{\psi}(s_t) $ 를 훈련시키며, $ \mathcal{D}_E $ 와 $ \mathcal{D}_U $ 에서 샘플링된 상태들 간의 교차 엔트로피 손실을 최소화한다.
  • 거짓 음성 결과를 완화하기 위해 양성-무료(PU) 학습을 도입하여 손실를 재가중함으로써, 레이블이 없는 데이터에 숨겨진 성공 사례가 포함된 경우에도 강건성을 향상시킨다.
  • 작업 관련 적대적 이행 학습(TRAIL)을 사용하여 보상 모델이 작업 관련 상태에 집중하도록 하여 일반화 능력과 성능을 향상시킨다.
  • 학습된 보상 함수를 사용하여 모든 트레이젝터리—시범 데이터와 레이블이 없는 에피소드—를 주석 처리하여 통합된 보상 주석이 부여된 데이터셋을 생성한다.
  • 최신 오프라인 RL 알고리즘(예: CRR)을 사용하여 완전히 주석 처리된 데이터셋에서 오프라인 강화학습을 수행함으로써, 온라인 롤아웃 없이도 정책 최적화를 가능하게 한다.
  • 적대적 이행 학습, PU 학습, 현대 오프라인 RL의 요소를 통합하여 샘플 효율적인 오프라인 정책 학습을 위한 확장 가능한 종단 간(end-to-end) 방법을 구축한다.

실험 결과

연구 질문

  • RQ1보상 신호가 전혀 없는 상황에서, 다양한 출처에서 온 혼합 품질의 레이블이 없는 로봇 경험 데이터를 효과적으로 활용하여 오프라인 정책 학습을 향상시킬 수 있는가?
  • RQ2전문가 데이터와 레이블이 없는 데이터를 기반으로 대조 학습을 통해 학습된 보상 모델이 충분히 일반화되어, 기존 행동 복제보다 뛰어난 정책 학습을 가능하게 하는가?
  • RQ3전문가 시범 데이터가 제한된 상황에서, 레이블이 없는 데이터의 양이 증가함에 따라 ORIL의 성능은 어떻게 변화하는가?
  • RQ4실제 보상 신호를 사용하는 최신 기법들과 비교해도 성능이 유사한데도, 학습 과정에서 완전히 오프라인이고 보상 없이 진행되는가?
  • RQ5PU 학습과 TRAIL을 사용할 경우, 보상 학습 단계에서 거짓 음성 결과와 저품질의 레이블이 없는 데이터에 대해 얼마나 강건해지는가?

주요 결과

  • ORIL은 다양한 연속 제어 및 로봇 조작 작업에서, 동일한 수의 시범 데이터로 훈련된 행동 복제(BBC)보다 일관되게 뛰어난 성능을 보인다.
  • ORIL의 성능은 레이블이 없는 데이터의 양이 증가함에 따라 단조롭게 향상되며, 확장성과 효과적인 데이터 활용 능력을 입증한다.
  • 레이블이 없는 데이터의 평균 품질이 낮아도 ORIL은 강건한 성능을 유지하며, 노이즈가 많거나 비최적의 트레이젝터리에 대해 저항력을 보인다.
  • 단지 10개의 시범 데이터만으로도 ORIL은 훨씬 더 큰 시범 데이터셋으로 훈련된 BC와 유사한 성능을 달성하며, 뛰어난 샘플 효율성을 보여준다.
  • 충분한 레이블이 없는 데이터가 확보된 경우, ORIL은 Jaco 암을 사용한 Insertion 작업에서 전문가 수준의 성능을 달성하지만, BC는 동일한 조건에서 전문가 성능에 도달하지 못한다.
  • ORIL은 작업 간 일반화 능력이 뛰어나며, 시범 데이터셋 크기를 3~5개 에피소드로 줄여도 일관된 성능 향상을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.