Skip to main content
QUICK REVIEW

[논문 리뷰] GenLoco: Generalized Locomotion Controllers for Quadrupedal Robots

Gilbert Feng, Hongbo Zhang|arXiv (Cornell University)|2022. 09. 12.
Robotic Locomotion and ControlEngineering인용 수 17
한 줄 요약

이 논문은 시뮬레이션 중에 로봇 형태를 무작위로 변형함으로써 다각형 로봇을 위한 일반화된 이동 제어기를 훈련하는 강화학습 프레임워크인 GenLoco를 소개한다. 다양한 크기, 질량, 다리 길이를 가진 절편적으로 생성된 다각형 로봇의 다양성 있는 집합에서 훈련함으로써, 결과적으로 얻어진 정책은 새로운 실제 로봇들—Unitree A1, MIT Mini Cheetah, CUHK Sirius—에 대해 훈련 없이도 제로샷 전이를 달성하며, 시뮬레이션 및 실제 환경에서 모두 로봇 전용 정책을 능가한다.

ABSTRACT

Recent years have seen a surge in commercially-available and affordable quadrupedal robots, with many of these platforms being actively used in research and industry. As the availability of legged robots grows, so does the need for controllers that enable these robots to perform useful skills. However, most learning-based frameworks for controller development focus on training robot-specific controllers, a process that needs to be repeated for every new robot. In this work, we introduce a framework for training generalized locomotion (GenLoco) controllers for quadrupedal robots. Our framework synthesizes general-purpose locomotion controllers that can be deployed on a large variety of quadrupedal robots with similar morphologies. We present a simple but effective morphology randomization method that procedurally generates a diverse set of simulated robots for training. We show that by training a controller on this large set of simulated robots, our models acquire more general control strategies that can be directly transferred to novel simulated and real-world robots with diverse morphologies, which were not observed during training.

연구 동기 및 목표

  • 각 새로운 다각형 플랫폼에 대해 로봇 전용 이동 제어기를 훈련하는 데 드는 높은 비용을 해결하기 위해.
  • 다양한 형태와 역학적 특성을 가진 로봇 간에 작동하는 이식 가능하고 일반적인 목적의 이동 정책을 가능하게 하기 위해.
  • 정책 학습 중 다양한 형태를 훈련시킴으로써 정밀한 시뮬레이션에서 현실로의 전이(sim-to-real) 의존도를 줄이기 위해.
  • 단일 정책이 정밀한 조정 없이도 여러 실제 다각형 로봇에 배포될 수 있음을 입증하기 위해.
  • 새로운 다각형 로봇을 위한 재사용 가능하고 오픈소스 기반을 제공하여 높은 비용의 재훈련이 필요 없도록 하기 위해.

제안 방법

  • 형태 템플릿 내에서 몸체 크기, 다리 길이, 질량을 무작위로 변형하여 절편적으로 생성된 다양한 시뮬레이션 다각형 로봇의 생성.
  • 이 다양성 있는 시뮬레이션 로봇 집합에서 역사 기반 딥 강화학습 정책을 훈련시켜 일반적인 제어 전략을 학습하기 위해.
  • 정책이 광범위한 운동학적 및 역학적 변형에 노출되도록 훈련 중 형태 무작위화를 적용하기 위해.
  • 모든 시뮬레이션 형태에 걸쳐 공유된 파rameter를 가진 단일 정책 헤드를 사용하여 일반화를 장려하기 위해.
  • 훈련 중에 볼 수 없었던 실제 로봇에 대해 제로샷 배포를 통해 전이 성능을 평가하기 위해.
  • 모든 시뮬레이션 로봇에서 자유도(DoFs)의 수와 링크 구조를 고정하여 아키텍처 일관성을 확보하기 위해.

실험 결과

연구 질문

  • RQ1다양한 형태를 가진 다각형 로봇 간에 일반화되는 단일 이동 정책을 훈련시킬 수 있는가?
  • RQ2단일 로봇에서 훈련하는 것과 비교해 형태 무작위화를 훈련 중에 적용하면 시뮬레이션에서 현실로의 전이 성능이 향상되는가?
  • RQ3시뮬레이션 로봇에서 훈련된 정책을 정밀한 조정 없이도 실제 로봇에 직접 배포할 수 있는가?
  • RQ4실제 환경에서의 배포 시 일반화된 정책의 성능은 로봇 전용 정책과 비교해 어떻게 되는가?
  • RQ5형태 무작위화가 분포 외 동역학 변화에 대한 강건성을 얼마나 향상시키는가?

주요 결과

  • GenLoco 정책는 페이싱 자세에서 Unitree A1에서 0.773 ± 0.054의 정규화 수익을 기록했으며, Mini Cheetah에서는 0.743 ± 0.092를 기록했고, 이는 A1 전용 정책(0.696 ± 0.032)과 Cheetah 전용 정책(6번의 시험 중 0)을 능가했다.
  • 스피닝 자세에서는 A1에서 0.670 ± 0.070, Cheetah에서는 0.721 ± 0.090의 성능을 기록했으며, A1 전용 정책(0.572 ± 0.049)과 Cheetah 전용 정책(0.258 ± 0.013)을 모두 능가했다.
  • Mini Cheetah 전용 정책는 시뮬레이션에서는 작동했지만 실제 환경의 6번의 시험 모두에서 실패했고, GenLoco 정책는 일관되게 성공했으며, 이는 더 뛰어난 시뮬레이션에서 현실로의 강건성을 보여주었다.
  • GenLoco 정책는 모터 마찰 및 강도 변화에 대해 뚜렷한 강건성을 보였으며, 분포 외 동역학 변화에 대한 효과적인 일반화를 나타냈다.
  • 최근 개발된 CUHK Sirius 로봇에 대한 배포가 하드웨어 가용성 이후 며칠 내에 이루어졌으며, 이는 제로샷 전이 능력을 확인했다.
  • 더 큰 로봇에서는 성능 저하가 관찰되어 극단적인 형태 변화 하에서 일반화 범위의 한계를 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.