Skip to main content
QUICK REVIEW

[논문 리뷰] OffWorld Gym: open-access physical robotics environment for real-world reinforcement learning benchmark and research

Ashish Kumar, Toby Buckley|arXiv (Cornell University)|2019. 10. 18.
Reinforcement Learning in Robotics참고 문헌 67인용 수 8
한 줄 요약

이 논문은 실세계 강화학습(RL) 기준 평가를 위한 오픈 액세스, 원격 액세스가 가능한 물리적 로봇 환경인 OffWorld Gym을 소개한다. 이 환경은 이산 제어와 연속 제어 각각 두 가지 작업을 포함하는 네 가지 실세계 RL 작업을 제공하며, 시각 입력만을 사용해 이동하는 이동형 로봇을 활용한다. 또한 사전 훈련을 위한 시뮬레이션된 동반 환경도 제공한다. 이 시스템은 표준 OpenAI Gym API를 통해 실제 하드웨어에서 엔드 투 엔드 훈련을 가능하게 하며, 실험 결과 Double DQN 및 SAC 에이전트의 성공적인 훈련을 확인함으로써 실현 가능성을 입증한다.

ABSTRACT

Success stories of applied machine learning can be traced back to the datasets and environments that were put forward as challenges for the community. The challenge that the community sets as a benchmark is usually the challenge that the community eventually solves. The ultimate challenge of reinforcement learning research is to train real agents to operate in the real environment, but until now there has not been a common real-world RL benchmark. In this work, we present a prototype real-world environment from OffWorld Gym -- a collection of real-world environments for reinforcement learning in robotics with free public remote access. Close integration into existing ecosystem allows the community to start using OffWorld Gym without any prior experience in robotics and takes away the burden of managing a physical robotics system, abstracting it under a familiar API. We introduce a navigation task, where a robot has to reach a visual beacon on an uneven terrain using only the camera input and provide baseline results in both the real environment and the simulated replica. To start training, visit https://gym.offworld.ai

연구 동기 및 목표

  • 실세계 물리적 로봇에서 강화학습을 위한 표준화되고 공개 가능한 기준 평가 기준을 구축하기 위해.
  • 익숙한 OpenAI Gym API를 통해 하드웨어 복잡성을 추상화하여 RL 연구의 진입 장벽을 낮추기 위해.
  • 기관 유지보수와 원격 액세스를 통해 실로봇 시스템에 대한 스케일링 가능한 장기 연구를 가능하게 하기 위해.
  • 실세계와 유사한 시뮬레이션 환경을 제공함으로써 시뮬레이션에서 실제 환경으로의 전이 갭을 해소하기 위해.
  • 비구조적 실세계 환경에서 샘플 효율적이고 시각 기반의 로봇 이동을 위한 강화학습의 진전을 가속화하기 위해.

제안 방법

  • 이 시스템은 RGB 및 깊이 카메라를 장착한 이동형 로봇을 사용하여, 불규칙한 지형과 장애물이 많은 환경에서의 이동을 포함하는 네 가지 실세계 RL 작업을 제공한다.
  • 모든 환경은 표준화된 OpenAI Gym 인터페이스를 통해 액세스 가능하며, 물리적 하드웨어를 추상화하여 기존 RL 프레임워크와 원활한 통합을 가능하게 한다.
  • 실세계 환경는 OffWorld Inc.에서 호스팅 및 유지보수되며, 시간 예약 제도를 통해 원격 액세스가 가능하여 스케일링을 보장한다.
  • 실세계 환경와 유사도가 높은 고정밀도의 시뮬레이션 환경이 제공되어 사전 훈련과 도메인 랜덤라이제이션을 가능하게 한다.
  • 이 시스템은 이산 제어와 연속 제어 양식을 모두 지원하며, 목표지점까지의 거리와 작업에 특화된 보상 설계에 기반한 희박한 또는 조밀한 보상 구조를 제공한다.
  • 아키텍처는 GPS나 위치 추적 데이터에 접근하지 않고도 시각 입력만으로 엔드 투 엔드 훈련이 가능하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트는 실세계 비구조적 환경에서 시각 입력만을 사용해 이동 정책을 성공적으로 학습시킬 수 있는가?
  • RQ2원격 액세스를 통해 실제 로봇 하드웨어에서 훈련되는 표준 RL 알고리즘(예: Double DQN, SAC)의 성능은 어떻게 스케일링되는가?
  • RQ3OffWorld Gym의 시뮬레이션 환경은 실세계 RL 기준 평가 및 전이 학습의 효과적인 대체 수 Mittel로 활용될 수 있는가?
  • RQ4오픈형 공유 물리적 환경을 사용해 실세계 로봇에서 견고하고 일반화 가능한 정책을 달성하는 것이 가능한가?
  • RQ5최소한의 하드웨어 및 유지보수 부담으로 장기적인 공동체 기반 실세계 RL 기준 평가를 어떻게 지속할 수 있는가?

주요 결과

  • 카메라 입력만을 사용해 이동형 로봇의 엔드 투 엔드 훈련이 실세계 환경에서 단순한 이동 작업을 성공적으로 해결함으로써, 물리적 시스템에서 시각 기반 RL의 실현 가능성을 입증하였다.
  • Double DQN 및 SAC 에이전트는 MonolithDiscrete 환경에서 안정적인 학습 곡선을 보이며 목표에 도달하여, 이 시스템이 RL 훈련에 실현 가능한 환경임을 확인하였다.
  • 시뮬레이션 환경은 실세계 환경와 매우 유사하여 신뢰할 수 있는 사전 훈련과 전이 학습이 가능하며, 이는 실세계 배포 시 샘플 복잡도를 감소시킬 수 있다.
  • 원격 액세스 모델은 연구자가 물리적 하드웨어를 소유하거나 유지보수할 필요 없이 RL 에이전트를 훈련하고 평가할 수 있도록 해, 진입 장벽을 크게 낮추었다.
  • 기관 유지보수와 하드웨어 액세스 시간 예약 제도를 통해 시스템은 장기적이고 스케일링 가능한 기준 평가를 지원한다.
  • 리더보드와 오픈 액세스 모델은 공동체 수준의 RL 알고리즘 비교 및 실세계 로봇에서의 발전을 촉진할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.