Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Robust Parameterized Locomotion Control of Bipedal Robots

Zhongyu Li, Xuxin Cheng|arXiv (Cornell University)|2021. 03. 26.
Robotic Locomotion and Control참고 문헌 38인용 수 12
한 줄 요약

이 논문은 하이브리드 제로 동역학(HZD) 기반의 가우지 라이브러리를 사용하여 캐시(Cassie) 이족 보행 로봇을 위한 강건하고 파rameterized된 보행 정책을 훈련하는 모델-프리 강화학습 프레임워크를 제안한다. 도메인 랜덤라이제이션과 동역학 변형을 사용하여 시뮬레이션에서 훈련함으로써 정책은 다양한 민첩한 가우지를 학습하게 되며, 이는 속도, 높이, 회전 등의 변화를 포함한다. 이로 인해 재훈련 없이도 모터 고장, 외부 자극, 환경 변화에 대한 실제 세계에서의 강건성을 확보할 수 있다.

ABSTRACT

Developing robust walking controllers for bipedal robots is a challenging endeavor. Traditional model-based locomotion controllers require simplifying assumptions and careful modelling; any small errors can result in unstable control. To address these challenges for bipedal locomotion, we present a model-free reinforcement learning framework for training robust locomotion policies in simulation, which can then be transferred to a real bipedal Cassie robot. To facilitate sim-to-real transfer, domain randomization is used to encourage the policies to learn behaviors that are robust across variations in system dynamics. The learned policies enable Cassie to perform a set of diverse and dynamic behaviors, while also being more robust than traditional controllers and prior learning-based methods that use residual control. We demonstrate this on versatile walking behaviors such as tracking a target walking velocity, walking height, and turning yaw.

연구 동기 및 목표

  • 기존의 모델 기반 접근 방식을 초월하여 다양한 동적 행동을 처리할 수 있는 강건하고 유연한 이족 보행 제어기를 개발하는 것.
  • 사전에 존재하는 기준 제어기에 의존하는 잔여 제어 방법의 한계를 극복하여 제한적이고 보수적인 가우지를 생성하는 것.
  • 실제 구현에서 모델링 오차, 환경 변화, 하드웨어 고장(예: 모터 손상)에 대한 강건성을 향상시키는 것.
  • 직접 다양한 HZD 기반 가우지를 모방하는 정책을 엔드 투 엔드로 훈련시켜 행동의 다양성과 안정성을 증가시키는 것.
  • 도메인 랜덤라이제이션을 사용하여 시뮬레이션에서 훈련된 정책을 실제 세계의 캐시 로봇으로 성공적으로 전이하는 것.

제안 방법

  • 하이브리드 제로 동역학(HZD)에서 유도된 파arameterized 운동의 가우지 라이브러리를 사용하여 애니메이션 학습을 위한 다양한 기준 궤적을 제공한다.
  • 잔여 제어 항목 없이, 다양한 가우지를 모방하는 정책을 훈련하기 위해 모델-프리 딥 강화학습을 적용한다.
  • 훈련 중에 도메인 랜덤라이제이션을 적용하여 특히 관절 다임프 비율과 기타 동역학 파라미터를 랜덤화함으로써 강건성을 향상시킨다.
  • 시스템 동역학과 환경 조건의 변형에 일반화하기 위해 시뮬레이션 환경(MuJoCo)에서 정책을 훈련시킨다.
  • 다양한 훈련 데이터에서 기인한 강건성을 활용하여, 추가 튜닝 없이도 실제 세계의 캐시 로봇에 훈련된 정책을 직접 전이한다.
  • 목표 보행 속도, 높이, 요 레이트 추적을 장려하고 안정성을 유지하는 보상 형태 설계를 사용한다.

실험 결과

연구 질문

  • RQ1HZD 기반의 다양한 가우지 라이브러리에서 훈련된 모델-프리 강화학습 정책이 시뮬레이션과 실제 세계 구현에서 강건하고 파arameterized된 보행을 달성할 수 있는가?
  • RQ2도메인 랜덤라이제이션을 통한 훈련이 모델링되지 않은 동역학(예: 모터 고장 또는 마찰 계수 변화)에 대한 강건성을 어떻게 향상시키는가?
  • RQ3잔여 제어를 제거하고 대신 가우지 라이브러리를 사용하여 애니메이션 학습을 수행함으로써 이전 방법에 비해 성능 향상과 더 넓은 명령 설정 가능 영역을 달성할 수 있는가?
  • RQ4재훈련 없이도 회전, 다양한 보행 높이, 외부 자극 복구와 같은 복잡한 행동에 일반화할 수 있는가?
  • RQ5학습된 정책이 실제 세계에서의 강건성 측면에서 모델 기반 HZD 제어기와 잔여 제어 베이스라인에 비해 어느 정도 뛰어난가?

주요 결과

  • 제안된 정책는 재훈련 없이도 실제 세계의 캐시 로봇이 다양한 보행 속도, 높이, 요 레이트를 추적하는 데 성공했다.
  • 오른쪽 다리의 두 개의 손상된 모터에 대해도, 튜닝 없이도 즉각적으로 안정된 보행을 유지하며 배포된 바 있다.
  • 시뮬레이션에서, 정책는 고강도 외부 자극(β = 0.8, 1.0) 조건에서도 비잔여 및 잔여 기반 베이스라인보다 우수한 외부 자극에 대한 저항성을 보였다.
  • 정책는 보행 전환 중 안정성이 향상되었고, HZD 기반 기본 제어기 대비 더 넓은 명령 설정 가능 영역과 안전 영역을 확보했다.
  • 정책는 앞, 뒤, 측면 방향의 밀림, 예기치 않은 하중 부여, 지면 마찰 계수 변화 등에 대해 성공적으로 복구했다.
  • 이 방법은 이전의 모델 기반 제어기로는 신뢰성 있게 달성할 수 없었던 민첩하고 동적인 행동, 예를 들어 빠른 걷기, 옆으로의 이동, 회전을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.