Skip to main content
QUICK REVIEW

[논문 리뷰] RMA: Rapid Motor Adaptation for Legged Robots

Ashish Kumar, Zipeng Fu|arXiv (Cornell University)|2021. 07. 08.
Robotic Locomotion and Control참고 문헌 58인용 수 16
한 줄 요약

RMA는 시뮬레이션에서 훈련된 기본 정책과 빠르게 적응하는 모듈을 통해 실시간으로 예측할 수 없는 지형에 적응할 수 있도록 하는 두 부분으로 구성된 강화학습 프레임워크이다. 이는 실제 세계에서의 미세조정 없이도 모래, 진흙, 식생이 우거진 지형에서 100% 성공률을 기록하고, 미끄럽거나 딱딱한 표면에서도 90% 성공률을 달성하여 저비용 하드웨어인 Unitree A1 로봇에서 강력하고 실시간으로 작동하는 운동 적응 능력을 입증한다.

ABSTRACT

Successful real-world deployment of legged robots would require them to adapt in real-time to unseen scenarios like changing terrains, changing payloads, wear and tear. This paper presents Rapid Motor Adaptation (RMA) algorithm to solve this problem of real-time online adaptation in quadruped robots. RMA consists of two components: a base policy and an adaptation module. The combination of these components enables the robot to adapt to novel situations in fractions of a second. RMA is trained completely in simulation without using any domain knowledge like reference trajectories or predefined foot trajectory generators and is deployed on the A1 robot without any fine-tuning. We train RMA on a varied terrain generator using bioenergetics-inspired rewards and deploy it on a variety of difficult terrains including rocky, slippery, deformable surfaces in environments with grass, long vegetation, concrete, pebbles, stairs, sand, etc. RMA shows state-of-the-art performance across diverse real-world as well as simulation experiments. Video results at https://ashish-kmr.github.io/rma-legged-robots/

연구 동기 및 목표

  • 다리 다는 로봇이 모래, 진흙, 계단과 같은 예측할 수 없는 실제 지형에 인간이 설계한 궤적이나 광범위한 실제 세계 데이터 수집에 의존하지 않고 실시간으로 신속히 적응할 수 있도록 하는 것.
  • 자기 체감 정보와 특권 환경 신호만을 사용하여 전체 적응 시스템을 시뮬레이션에서 훈련함으로써 시뮬레이션에서 실제 세계로의 일반화 갭을 줄이는 것.
  • 저비용 로봇에서 제한된 온보드 처리 능력을 가진 플랫폼에서도 실시간 적응을 가능하게 하는 계산적으로 효율적이고 비동기적 제어 아키텍처를 개발하는 것.
  • 명시적인 시스템 식별이나 사전 정의된 운동 템플릿 없이도, 외재적 상태 표현의 엔드 투 엔드 학습에 의존하여 온라인 적응을 달성할 수 있도록 하는 것.
  • 기존 방법이 종종 실패하는 어려운 외부 지형, 예를 들어 돌무더기, 미끄러운 표면, 변형 가능한 표면에서 이 방법의 유효성을 검증하는 것.

제안 방법

  • RMA 프레임워크는 기본 정책 π와 적응 모듈 φ로 구성되며, 두 단계로 훈련된다: 첫 번째 단계에서 π는 환경 인자 et에 접근할 수 있는 모델 자유형 강화학습을 사용하여 시뮬레이션에서 훈련된다.
  • 환경 인자 et는 전용 인코더 μ를 통해 잠재 외재 벡터 zt로 인코딩되며, 이는 기본 정책이 지형 특성에 따라 행동을 조정할 수 있도록 한다.
  • 두 번째 단계에서 적응 모듈 φ는 온정책 데이터를 사용한 지도 학습을 통해 과거 상태와 행동의 역사에서 ẑt를 예측하도록 훈련되어, 지형 특성의 실시간 추정을 가능하게 한다.
  • 배포 시, 적응 모듈은 10Hz로 작동하여 ẑt를 예측하고, 이는 100Hz로 작동하는 기본 정책에 공급되어 PD 제어기를 통해 관절 위치 명령을 생성한다.
  • 비동기 설계 덕분에 기본 정책는 최신의 ẑt 예측을 사용할 수 있어 지연을 최소화하고 저성능 플랫폼에서도 실시간 적응이 가능하다.
  • 훈련 중에 생물 에너지학적 영감을 받은 보상 함수를 사용하여 다양한 지형, 특히 변형 가능한 표면와 불균일한 표면에서도 에너지 효율적인 운동을 장려한다.

실험 결과

연구 질문

  • RQ1다리 다는 로봇이 사전에 실제 세계 경험 없이도 또는 실세계에서의 미세조정 없이도 예측할 수 없는 지형(예: 모래, 진흙, 계단)에 실시간으로 적응할 수 있는가?
  • RQ2전적으로 시뮬레이션에서 훈련된 정책이 접촉 역학과 변형성의 물리적 차이가 큰 실제 세계 지형으로 일반화될 수 있는가?
  • RQ3자기 체감 정보와 학습된 외재 상태 추정만을 사용하여도 명시적인 시스템 식별이나 운동 템플릿 없이도 신속한 적응이 가능한가?
  • RQ4적응 모듈은 미끄러운 패치나 발이 갇히는 상황과 같은 갑작스러운 지형 변화를 탐지하고 반응하는 데 얼마나 효과적인가?
  • RQ5경량 비동기 제어 아키텍처는 제한된 온보드 계산 능력을 가진 저비용 로봇에서 실시간 적응을 가능하게 할 수 있는가?

주요 결과

  • RMA는 모래, 진흙, 흙 지형에서 100% 성공률을 기록하여 보행 중 침몰이나 발이 빠지는 현상에 대한 강건성을 입증했다.
  • 높은 식생과 덤불 장애물이 있는 지형을 통과하는 시험에서 100% 성공률를 기록하여 주기적인 불안정성과 발이 갇히는 상황에 효과적으로 적응함을 보였다.
  • 산책로에서 발견된 계단에 대해 RMA는 훈련을 받은 바 없음에도 불구하고 70% 성공률을 기록하여 강력한 제로샷 일반화 능력을 보였다.
  • 기름이 바르진 흙더미를 내리막으로 건너는 시험에서 100% 성공률를 기록했고, 시멘트 더미와 자갈 더미를 기름진 기울기에서 건너는 데도 80% 성공률를 기록하여 복잡하고 불안정한 표면에서의 성능을 입증했다.
  • 미끄러운 표면에서 RMA는 기름을 바른 시험에서 90% 성공률를 기록했으며, 적응 모듈이 미끄러움을 감지하고 보행 패턴과 토크 프로파일을 조정함으로써 효과적으로 대응했다.
  • 절단 실험 결과, 적응 모듈을 제거하면 성능이 크게 떨어져, 실시간 지형 적응에서 이 모듈의 핵심적인 역할을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.