Skip to main content
QUICK REVIEW

[논문 리뷰] ROBEL: Robotics Benchmarks for Learning with Low-Cost Robots

Michael J. Ahn, Henry Zhu|arXiv (Cornell University)|2019. 09. 25.
Reinforcement Learning in Robotics참고 문헌 37인용 수 11
한 줄 요약

ROBEL은 저비용, 모듈식 로봇 플랫폼을 개방형으로 제공한다. D'Claw(9-DOF 조작), D'Kitty(12-DOF 이동)로 구성되며, 실제 환경에서 강화학습을 위한 설계이다. 재현 가능하고 하드웨어에 안전한 훈련이 가능하며, 조밀한/희박한 목적함수와 안전성 지표를 지원하여 실제 환경에서 14,000시간 이상의 훈련을 수행했고, 독립적으로 제작된 로봇 간 정책 복제가 가능하다.

ABSTRACT

ROBEL is an open-source platform of cost-effective robots designed for reinforcement learning in the real world. ROBEL introduces two robots, each aimed to accelerate reinforcement learning research in different task domains: D'Claw is a three-fingered hand robot that facilitates learning dexterous manipulation tasks, and D'Kitty is a four-legged robot that facilitates learning agile legged locomotion tasks. These low-cost, modular robots are easy to maintain and are robust enough to sustain on-hardware reinforcement learning from scratch with over 14000 training hours registered on them to date. To leverage this platform, we propose an extensible set of continuous control benchmark tasks for each robot. These tasks feature dense and sparse task objectives, and additionally introduce score metrics as hardware-safety. We provide benchmark scores on an initial set of tasks using a variety of learning-based methods. Furthermore, we show that these results can be replicated across copies of the robots located in different institutions. Code, documentation, design files, detailed assembly instructions, final policies, baseline details, task videos, and all supplementary materials required to reproduce the results are available at www.roboticsbenchmarks.org.

연구 동기 및 목표

  • 모의 환경과 실제 환경 간 격차를 해소하기 위해 스케일업 가능하고 저비용이며 실제 환경에서의 훈련을 가능하게 한다.
  • 손상 취약성과 유지보수 요구가 높아 실험-오류 학습에 부적합한 고비용 산업용 로봇의 한계를 극복한다.
  • 장기적인 현장에서의 강화학습 실험을 지원하기 위해 내구성 있고 모듈식이며 쉽게 재현 가능한 하드웨어 플랫폼을 제공한다.
  • 물리적 제약을 고려하고 손상 위험을 줄이기 위해 하드웨어 안전성 지표를 도입한다.
  • 서로 다른 기관 간에 직접 협력 없이도 동일한 로봇 복제체 간에 강화학습 정책을 재현 가능하게 한다.

제안 방법

  • 저비용, 모듈식 로봇 두 종류를 설계 및 배포: D'Claw(세 손가락 손)은 정교한 조작을 위해, D'Kitty(사지형)는 민첩한 이동을 위해.
  • 각 로봇에 대해 연속 제어 벤치마크 과제 세트를 구현하며, 조밀한 보상 함수와 희박한 보상 함수를 모두 포함한다.
  • 궤적 동안 위치, 속도, 토크 위반을 추적하는 하드웨어 안전성 목표를 통합하여 위험을 정량화한다.
  • 실제 환경 역학을 유지하면서도 빠른 정책 프로토타이핑을 위한 시뮬레이션 백엔드를 통합한다.
  • 코드, 설계 파일, 조립 지침, 훈련된 정책, 기준 결과를 공개하여 완전한 재현 가능성을 확보한다.
  • 모듈식 하드웨어 설계를 통해 고장 난 부품(예: 모터)의 쉽게 교체 가능성을 확보하고 장기 실험을 지원한다.

실험 결과

연구 질문

  • RQ1저비용, 모듈식 로봇이 14,000시간 이상의 실제 환경 강화학습을 수행하면서도 상당한 열화 없이 지속 가능한가?
  • RQ2ROBEL 로봇의 복제본 중 하나에서 훈련된 정책이 60마일 떨어진 물리적으로 동일한 복제본에서 성공적으로 이식되고 재현 가능한가?
  • RQ3하드웨어 안전성 지표는 강화학습 훈련 중에 위험한 행동을 식별하고 정량화하는 데 얼마나 효과적인가?
  • RQ4SAC, DAPG, BC, NPG 등의 다양한 기반 학습 방법이 실제 하드웨어에서 표준화된 벤치마크 과제에서 일관된 성능을 달성할 수 있는가?
  • RQ5고비용 산업용 시스템에 비해 ROBEL 플랫폼이 실제 환경 강화학습 연구의 진입 장벽을 얼마나 줄이는가?

주요 결과

  • ROBEL 로봇은 실제 환경에서 14,000시간 이상의 훈련을 축적하여 장기적인 하드웨어 내구성과 신뢰성을 입증했다.
  • D'Claw 로봇에서 훈련된 정책이 60마일 떨어진 물리적으로 동일한 복제본에서 성공적으로 재현되었으며, 이격된 장소 간 재현 가능성 확인.
  • 안전성 지표는 성공적인 과제 수행 정책조차도 상당한 관절 위치, 속도 또는 토크 위반을 겪고 있음을 드러내어 명시적 안전 제약 조건의 필요성을 강조한다.
  • 모듈식 설계 덕분에 느슨한 볼트나 흔한 모터 고장 외에는 최소한의 마모가 발생했으며, 모두 쉽게 수리 가능했다.
  • SAC, DAPG, BC, NPG 방법을 사용한 벤치마크 결과는 향후 다양한 학습 알고리즘 간 비교를 위한 표준 기준을 제공한다.
  • 플랫폼은 최소한의 인간 감시로 일관되고 스케일업 가능하며 안전한 실제 환경 강화학습 실험을 가능하게 하여 고비용 인프라 의존도를 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.