Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Dexterous Manipulation from Suboptimal Experts

Rae Jeong, Jost Tobias Springenberg|arXiv (Cornell University)|2020. 10. 16.
Reinforcement Learning in Robotics참고 문헌 21인용 수 12
한 줄 요약

이 논문은 고차원적 로봇 조작 작업에서 매우 이완된 전문가 데이터와 온정책 탐색을 효과적으로 융합하는 Relative Entropy Q-Learning (REQ)를 소개한다. 학습된 사전 분포에서의 중요도 샘플링과 KL 제약 조건을 적용하여, REQ는 오프정책, 오프라인, 암시적 학습 환경에서 강력한 기준 모델들을 능가하며, 복합적인 작업을 위해 구성된 웨이포인트 제어기나 학습된 프리미티브와 같은 열악한 전문가 데이터로부터도 샘플 효율적인 학습을 가능하게 한다.

ABSTRACT

Learning dexterous manipulation in high-dimensional state-action spaces is an important open challenge with exploration presenting a major bottleneck. Although in many cases the learning process could be guided by demonstrations or other suboptimal experts, current RL algorithms for continuous action spaces often fail to effectively utilize combinations of highly off-policy expert data and on-policy exploration data. As a solution, we introduce Relative Entropy Q-Learning (REQ), a simple policy iteration algorithm that combines ideas from successful offline and conventional RL algorithms. It represents the optimal policy via importance sampling from a learned prior and is well-suited to take advantage of mixed data distributions. We demonstrate experimentally that REQ outperforms several strong baselines on robotic manipulation tasks for which suboptimal experts are available. We show how suboptimal experts can be constructed effectively by composing simple waypoint tracking controllers, and we also show how learned primitives can be combined with waypoint controllers to obtain reference behaviors to bootstrap a complex manipulation task on a simulated bimanual robot with human-like hands. Finally, we show that REQ is also effective for general off-policy RL, offline RL, and RL from demonstrations. Videos and further materials are available at sites.google.com/view/rlfse.

연구 동기 및 목표

  • 희소 보상과 제한된 탐색이 존재하는 고차원 로봇 조작 작업에서 샘플 효율성의 과제를 해결하기 위해.
  • 열악한 전문가 데이터와 온정책 롤아웃에서 유래한 혼합 데이터 분포를 효과적으로 활용하는 통합 강화학습 알고리즘을 개발하기 위해.
  • 복잡한 작업을 위해 학습된 프리미티브와 웨이포인트 제어기를 조합하여 열악한 전문가를 구성할 수 있음을 보여주기 위해.
  • 전문가 행동과 정책 행동을 번갈아가며 적용함으로써 어려운 조작 환경에서 풍부한 상태 커버리지가 가능해지는 탐색 전략을 제안하기 위해.
  • REQ의 효과성을 오프정책 강화학습, 오프라인 강화학습, 암시적 학습 환경에서 검증하기 위해.

제안 방법

  • REQ는 학습된 사전 정책에 대한 KL 발산 제약 조건 하에서 정책을 최적화하는 정책 반복 알고리즘이다.
  • 혼합된 데이터셋(오프정책 전문가 데이터와 온정책 롤아웃)에서 Q값을 중요도 샘플링을 통해 추정한다.
  • 알고리즘은 정책을 기대 Q값을 최대화하도록 업데이트하면서도, KL 정규화를 통해 사전 정책에 가까운 유지 보장을 한다.
  • 고차원적 조작을 위한 민감한 움직임을 위해 웨이포인트 추적 제어기와 학습된 프리미티브를 조합하여 열악한 전문가를 구성한다.
  • 롤아웃 중 정책 행동과 전문가 행동을 번갈아가며 적용함으로써 상태 커버리지 향상을 위한 통합 탐색 전략을 구현한다.
  • 방법은 딥마인드 컨트롤 스위트와 시뮬레이션된 셰이드 핸드를 사용한 双수 레고 쌓기 작업에서 평가되었다.

실험 결과

연구 질문

  • RQ1단일 강화학습 알고리즘이 고차원 제어 작업에서 매우 이완된 전문가 데이터와 온정책 탐색을 효과적으로 융합하여 샘플 효율성을 향상시킬 수 있는가?
  • RQ2복잡한 민감한 조작 작업을 위해 모듈러하고 직관적인 방식으로 열악한 전문가를 구성할 수 있는가?
  • RQ3전문가 행동과 정책 행동을 번갈아가며 적용하는 전략이 표준 탐색 전략보다 더 나은 탐색 성능과 더 빠른 수렴을 이끌 수 있는가?
  • RQ4REQ는 작업에 특화된 튜닝 없이 오프정책, 오프라인, 암시적 학습 환경 전반에서 일반화 가능한가?
  • RQ5조합된 전문가(프리미티브 + 제어기)가 복잡한 조작 작업의 학습을 얼마나 효과적으로 부트스트랩할 수 있는가?

주요 결과

  • REQ는 딥마인드 컨트롤 스위트에서 D4PG, CRR, 행동 복제와 같은 강력한 기준 모델들을 능가하며, 9개 작업 중 6개에서 가장 높은 수익을 기록했다.
  • 어려운 双수 레고 쌓기 작업에서 REQfSE는 열악한 전문가의 성능을 초월하는 정책을 학습하여, 조합된 행동으로부터 효과적인 부트스트랩이 가능함을 입증했다.
  • 오프라인 강화학습 환경에서 REQ는 최고 수준의 성능을 기록했으며, 카트폴에서는 860±7, 워커 스탠드에서는 929±46, 피시 스위밍에서는 592±41의 수익을 기록했다.
  • 통합 탐색 전략의 적용은 샘플 효율성을 크게 향상시켰으며, 표준 탐색 전략이 실패하는 환경에서도 학습이 가능하게 했다.
  • REQ는 아키텍처나 하이퍼파라미터 변경 없이도 오프정책, 오프라인, 암시적 학습 벤치마크 전반에서 뛰어난 일반화 성능을 보였다.
  • 학습된 프리미티브와 웨이포인트 제어기를 조합하여 구성한 열악한 전문가들은 효과적인 작업 분해와 복잡한 고차원 작업에서의 성공적인 정책 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.