Skip to main content
QUICK REVIEW

[논문 리뷰] Rapid Locomotion via Reinforcement Learning

Gabriel B. Margolis, Ge Yang|arXiv (Cornell University)|2022. 05. 05.
Robotic Locomotion and Control인용 수 6
한 줄 요약

이 논문은 MIT Mini Cheetah를 위한 종단 간 강화학습 컨트롤러를 제안하며, 잔디, 얼음, 자갈과 같은 다양한 지형에서 최고 기록인 3.9 m/s의 속도를 지속적으로 달성한다. 이 방법은 속도 명령어에 대한 적응형 커리큘럼과 온라인 시스템 식별을 사용하여 시뮬레이션에서 실제 세계로의 전이를 위해 0-샷(Zero-shot) 전이를 가능하게 하며, 시각이나 수작업으로 설계된 모델 없이 고속 달리기, 회전, 강인한 외부 간섭 대응 기능을 제공한다.

ABSTRACT

Agile maneuvers such as sprinting and high-speed turning in the wild are challenging for legged robots. We present an end-to-end learned controller that achieves record agility for the MIT Mini Cheetah, sustaining speeds up to 3.9 m/s. This system runs and turns fast on natural terrains like grass, ice, and gravel and responds robustly to disturbances. Our controller is a neural network trained in simulation via reinforcement learning and transferred to the real world. The two key components are (i) an adaptive curriculum on velocity commands and (ii) an online system identification strategy for sim-to-real transfer leveraged from prior work. Videos of the robot's behaviors are available at: https://agility.csail.mit.edu/

연구 동기 및 목표

  • 잔디, 얼음, 자갈과 같은 다양한 자연 지형에서 고속의 전방위 이동을 가능하게 하기 위해.
  • 높은 속도로 속도 명령어를 확장할 때 다중 작업 강화학습에서 발생하는 학습 불안정성을 극복하기 위해.
  • 수작업으로 설계된 역학 모델에 의존하지 않고 강인한 0-샷 시뮬레이션에서 실제 세계로의 전이를 달성하기 위해.
  • 종단 간 학습을 통해 삼진 회복 및 모터 고장 보상과 같은 탄생하는 행동을 보여주기 위해.
  • 최소한의 센서와 확장 가능한 정책 학습을 사용하여 다리 달리는 로봇의 민첩성의 한계를 극복하기 위해.

제안 방법

  • 고속의 전방위 이동을 장려하는 보상 함수를 사용하여 시뮬레이션에서 종단 간 딥 강화학습 정책을 훈련한다.
  • 적응형 커리큘럼은 물리적 타당성 기반으로 속도 명령어의 집합을 동적으로 확장하여, 훈련 초반에 비현실적이거나 과도하게 어려운 작업을 피한다.
  • 온라인 시스템 식별을 사용하여 시뮬레이션된 정책을 실제 세계의 동역학에 캘리브레이션함으로써 0-샷 배포를 가능하게 한다.
  • 정책은 시각이나 지형 기하학 정보 없이 프опrioceptive 상태(관절 각도, 속도, 자이로스코프)와 속도 명령어만 관측한다.
  • 각 선형 및 각속도의 고유 조합을 별개의 작업으로 간주하는 다중 작업 강화학습 설정을 사용한다.
  • 샘플 효율성과 일반화를 향상시키기 위해 교사-학생 디스틸레이션 전략을 적용하지만, 핵심 방법은 직접 종단 간 학습에 의존한다.
Figure 1 : An end-to-end learned controller enables the MIT Mini Cheetah to execute: (a) fast sprinting at $3.9\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ (top); (b) a rough terrain $10$ -meter sprint at $3.4\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ ; (c) high-speed spinning indoors; and (d) robust spin
Figure 1 : An end-to-end learned controller enables the MIT Mini Cheetah to execute: (a) fast sprinting at $3.9\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ (top); (b) a rough terrain $10$ -meter sprint at $3.4\text{\,}\mathrm{m}\mathrm{/}\mathrm{s}$ ; (c) high-speed spinning indoors; and (d) robust spin

실험 결과

연구 질문

  • RQ1시각이나 지형 감지 기능 없이 종단 간 강화학습 정책이 다양한 자연 지형에서 고속 이동을 달성할 수 있는가?
  • RQ2커리큘럼 학습을 물리적 제약 조건에 자동으로 적응시켜 고속 이동 훈련의 안정성을 확보할 수 있는가?
  • RQ3프로 prioceptive 피드백만으로 0-샷 전이를 통해 시뮬레이션에서 실제 세계로의 전이를 어느 정도 달성할 수 있는가?
  • RQ4복잡하고 고속의 이동 작업에서 종단 간 학습을 통해 어떤 탄생 행동이 나타나는가?
  • RQ5민첩성과 강인성 측면에서 수작업으로 설계된 모델 예측 제어기와 비교했을 때 학습된 정책의 성능은 어떠한가?

주요 결과

  • 컨트롤러는 평탄한 지형에서 지속적인 최고 속도 3.9 m/s를 달성하여 MIT Mini Cheetah의 신기록을 수립했다.
  • 불규칙한 잔디 지형에서 10미터 스프린트 동안 평균 속도 3.4 m/s를 유지하여 지형의 불규칙성에 대한 강인성을 입증했다.
  • 평탄한 지형에서 고속으로 5.7 rad/s의 속도로 회전을 수행했으며, 얼음 지형에서도 성공적으로 회전을 수행하여 강력한 외부 간섭 저항 능력을 보였다.
  • 실제 세계 배포 중에 삼진 회복 및 고장난 모터 보상과 같은 탄생 행동이 관측되었다.
  • 컨트롤러는 Froude 수치 5.1을 기록하여 Mini Cheetah에서 보고된 바 가장 높은 수치를 기록했으며, Cheetah 2에 비해 낮다.
  • 시뮬레이션에서 실제 세계로의 0-샷 전이가 잔디, 얼음, 자갈과 같은 다양한 지형에서 성공적으로 이루어졌으며, 실제 세계 캘리브레이션 없이도 가능했다.
Figure 2 : Our controller is a learned mapping from sensory inputs to desired joint positions. We parameterize it as 5-layer neural network $\pi_{\theta}$ with parameters $\theta$ optimized in simulation.
Figure 2 : Our controller is a learned mapping from sensory inputs to desired joint positions. We parameterize it as 5-layer neural network $\pi_{\theta}$ with parameters $\theta$ optimized in simulation.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.