Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Agile Robotic Locomotion Skills by Imitating Animals

Xue Bin Peng, Erwin Coumans|arXiv (Cornell University)|2020. 04. 02.
Robotic Locomotion and Control인용 수 41
한 줄 요약

본 논문은 실제 동물 모션을 모방하여 민첩한 보행 기술을 습득하도록 하는 모방학습 프레임워크를 제시한다. 이는 도메인 무작위화를 사용한 시뮬레이션에서 학습되며, 잠재공간 적응을 통해 실제 로봇으로 전달된다.

ABSTRACT

Reproducing the diverse and agile locomotion skills of animals has been a longstanding challenge in robotics. While manually-designed controllers have been able to emulate many complex behaviors, building such controllers involves a time-consuming and difficult development process, often requiring substantial expertise of the nuances of each skill. Reinforcement learning provides an appealing alternative for automating the manual effort involved in the development of controllers. However, designing learning objectives that elicit the desired behaviors from an agent can also require a great deal of skill-specific expertise. In this work, we present an imitation learning system that enables legged robots to learn agile locomotion skills by imitating real-world animals. We show that by leveraging reference motion data, a single learning-based approach is able to automatically synthesize controllers for a diverse repertoire behaviors for legged robots. By incorporating sample efficient domain adaptation techniques into the training process, our system is able to learn adaptive policies in simulation that can then be quickly adapted for real-world deployment. To demonstrate the effectiveness of our system, we train an 18-DoF quadruped robot to perform a variety of agile behaviors ranging from different locomotion gaits to dynamic hops and turns.

연구 동기 및 목표

  • 학습 기반 방법을 통해 로봇에서 동물과 유사한 민첩성을 달성하는 문제를 동기화하고 형식화한다.
  • 실제 동물 모션 데이터를 활용하여 정책 학습을 지도하고, 기술별 보상을 수작업으로 설계하지 않는다.
  • 도메인 무작위화와 잠재 공간 적응을 통한 샘플 효율적인 시뮬레이션-실제(Sim-to-Real) 전이를 개발한다.
  • 18-DoF Laikago quadruped에서 다양한 민첩한 행동을 학습하고 이를 실제 로봇으로 전달하는 것을 시연한다.

제안 방법

  • 역운동학을 사용하여 동물 모션 클립을 로봇 형태에 맞게 재타깃한다.
  • 목표 조건 입력을 갖춘 재타깃 모션을 재현하기 위해 시뮬레이션에서 모션 모방 정책을 학습한다.
  • 참고 궤적을 일치시키기 위해 PD 제어 토크 출력과 자세/속도 기반 보상을 사용한다.
  • 학습 중 정책이 다양한 동역학에 노출되도록 도메인 무작위화를 도입한다.
  • 무작위화된 동역학을 나타내는 잠재 변수 z에 정책을 조건시키는 잠재 동역학 인코더를 도입하고, 정보 병목을 통해 강건성과 적응성의 균형을 맞춘다.
  • 소수의 시도으로 실제 로봇에서 잠재 인코딩 z를 적응시키기 위해 advantage-weighted regression 기반 적응 절차(AWR)를 적용한다.

실험 결과

연구 질문

  • RQ1실제 동물 모션을 다족 보행 로봇의 견고하고 다양한 보행 기술 학습에 효과적으로 사용할 수 있는가?
  • RQ2모션 모방과 잠재 공간 적응에 의해 안내될 때 다이나믹한 보폭들에 걸쳐 시뮬레이션-실제 전이가 견고하게 성립하는가?
  • RQ3잠재 동역학 인코딩에 정보 병목을 강제하는 것이 실세계 배치에서의 강건성과 적응성에 어떻게 영향을 미치는가?
  • RQ4도메인 무작위화와 잠재 공간 적응의 조합이 비적응적 또는 비무작위화 기초(Base)에 비해 현실 세계 성능에 미치는 영향은 얼마나 되는가?

주요 결과

  • 정책은 18-DoF Laikago quadruped에서 보행, 점프, 회전 등 다양한 민첩 기술에 적응한다.
  • 적응형 정책은 대부분의 기술에서 실제 로봇으로 전달될 때 비적응 기초 대비 성능이 우수하다.
  • 적응 방법은 (예: Dog Pace, Dog Spin) 같은 동적 기술을 강건하지만 비적응 정책보다 더 안정적으로 수행하게 한다.
  • 학습은 정책당 약 200 million 시뮬레이션 샘플과 약 50회의 실제 실험을 사용하여 행동을 적응시킨다.
  • 잠재 공간 적응으로 학습된 정책은 보지 못한 다양한 동적 환경에 대해 비적응 정책보다 일반화가 더 잘 된다.
  • 역방향 모카프 데이터(예: 개 보행)는 제조사 보행보다 실제 세계 속도가 더 빨라질 수 있다(예: 1.08 m/s vs 0.84 m/s).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.