Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Multiple Gaits within Latent Space for Quadruped Robots

Jinze Wu, Yufei Xue|arXiv (Cornell University)|2023. 08. 06.
Robotic Locomotion and ControlEngineering인용 수 3
한 줄 요약

이 논문은 자이로스코프 피드백만을 사용하여 다각형 로봇의 여러 보행 방식을 학습할 수 있는 엔드 투 엔드 강화 학습 프레임워크를 제안한다. 이는 보행 인코더와 생성기로 구성된 동시에 학습되는 잠재 공간을 통해 구현되며, 적응형이고 부드러운 보행 전환과 사용자 제어가 가능한 보행 행동을 가능하게 한다. 이 방법은 자이로스코프 피드백만을 사용하여 계단 오르기에서 100% 성공률을 기록하고, 잔디 위에서의 민첩한 스프린트에서는 80% 성공률을 달성하여 이전 방법들보다 더 뛰어난 내구성과 적응성 확보를 이룬다.

ABSTRACT

Learning multiple gaits is non-trivial for legged robots, especially when encountering different terrains and velocity commands. In this work, we present an end-to-end training framework for learning multiple gaits for quadruped robots, tailored to the needs of robust locomotion, agile locomotion, and user's commands. A latent space is constructed concurrently by a gait encoder and a gait generator, which helps the agent to reuse multiple gait skills to achieve adaptive gait behaviors. To learn natural behaviors for multiple gaits, we design gait-dependent rewards that are constructed explicitly from gait parameters and implicitly from conditional adversarial motion priors (CAMP). We demonstrate such multiple gaits control on a quadruped robot Go1 with only proprioceptive sensors.

연구 동기 및 목표

  • 사용자 명령에 따라 보행 방식(예: 걷기, 뛰기, 걷기, 점프, 뛰기 등)을 학습하고 전환할 수 있도록 다각형 로봇을 가능하게 하기.
  • 시각 정보에 의존하지 않고도 계단이나 불규칙한 잔디와 같은 복잡한 지형에서 보행의 내구성과 민첩성을 향상시키기.
  • 다양하고 자연스러운 보행 행동을 학습하면서도 실시간 제어와 부드러운 전환을 유지하는 도전 과제 해결하기.
  • 이전의 RL 방법들이 보상 설계의 열악함이나 고정된 저수준 정책로 인해 부드럽지 못한 움직임을 유도하거나 다양한 지형에서 일반화 실패 문제를 해결하기.
  • 보행에 따라 달라지는 보상과 조건부 적대적 운동 사전(CAMP)을 통합하여 자연스러운 보행 생성을 위한 통합 프레임워크 개발하기.

제안 방법

  • 다양한 보행 행동을 위한 단일 정책을 엔드 투 엔드로 학습하기 위해 비대칭 액터-크리틱 강화 학습 프레임워크를 사용한다.
  • 보행 인코더와 보행 생성기를 통해 동시에 학습되는 잠재 공간 Z를 도입하여, 다양한 보행 스킬 간의 부드러운 보간과 선택을 가능하게 한다.
  • 명시적 보행 파라미터와 암묵적 조건부 적대적 운동 사전(CAMP)을 활용하여 보행에 따라 달라지는 보상을 설계하여 자연스러운 운동 생성을 유도한다.
  • CAMP 구성 요소는 조건부 판별기를 사용하여 생성된 운동이 다양한 전문가 보행 데이터셋의 스타일과 역학을 정확히 반영하도록 보장한다.
  • 외부 센서 없이 자이로스코프 관측만을 사용하여 프레임워크를 학습함으로써 실제 하드웨어에서 실시간 제어를 가능하게 한다.
  • 스킬 표현(잠재 공간)과 임무에 특화된 정책 적응을 분리함으로써 다보행 학습에서의 임무 간 충돌 문제를 회피한다.

실험 결과

연구 질문

  • RQ1단일 엔드 투 엔드 RL 정책이 자연스럽고 부드러운 운동을 유지하면서도 실시간 성능을 확보하면서도 여러 보행 방식을 학습하고 전환할 수 있는가?
  • RQ2동시에 학습되는 잠재 공간이 다각형 보행에서 보행 전환의 부드러움과 스킬 재사용성에 어떻게 기여하는가?
  • RQ3보행에 따라 달라지는 보상과 CAMP를 사용하여 학습된 정책이 시각 정보 없이도 계단이나 잔디와 같은 복잡한 지형으로 일반화될 수 있는 정도는 어느 정도인가?
  • RQ4계단과 같은 도전적인 지형에서 계층적 또는 교사-학생 프레임워크와 비교할 때 본 방법의 내구성과 민첩성은 어떠한가?
  • RQ5자이로스코프 피드백만으로도 사용자가 보행 유형과 속도를 제어할 수 있도록 하면서 높은 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 20cm 높이, 25cm 폭의 계단 오르기에서 100% 성공률를 기록하여 기준 방법들을 능가했다.
  • 2.5m/s 속도로 잔디 위에서 민첩한 보행을 수행한 결과, 80% 성공률를 달성하여 MoB 기준 방법(20%)과 이전 기준 방법(60%)보다 뚜렷이 뛰어났다.
  • 적응형 보행(C)은 계층적 방법(H)보다 고층 계단과 급경사에서 뛰어난 내구성을 보이며, 저수준 정책의 더 나은 일반화 능력을 나타냈다.
  • 지속적인 잠재 공간 덕분에 다양한 보행 스킬 간의 보간이 가능해져, 갑작스러운 움직임 없이 부드러운 보행 전환이 달성되었다.
  • 기준 방법이 교사-학생 프레임워크를 사용하고 있음에도 불구하고, 비대칭 액터-크리틱 설정으로 인한 더 작은 시뮬레이션-실세계 간 격리로 인해, 뛰어난 내구성 및 민첩성 작업 성능을 확보했다.
  • 시스템은 자연스러운 운동 스타일을 유지하면서 사용자 명령에 따라 6가지의 구분되는 보행 유형—걷기, 뛰기, 걷기, 점프, 뛰기, 적응형 보행—을 성공적으로 학습하고 실행했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.