Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning for Quadruped Locomotion

Deepali Jain, Atıl Işçen|arXiv (Cornell University)|2019. 05. 22.
Robotic Locomotion and Control참고 문헌 14인용 수 10
한 줄 요약

이 논문은 종복 보행에 적합한 계층적 강화학습 프레임워크를 제안하며, 종단 간 훈련을 통해 저수준의 운동 기술을 자동으로 발견한다. 고수준 정책은 잠재 명령을 내리고 실행 지속 시간을 결정하는 반면, 저수준 정책은 차량 내 센서 데이터에 기반해 실행되며, 이는 임무에 종속되지 않는 스킬 학습, 이식 가능성, 그리고 향상된 효율성과 함께 잠재적 조향 행동을 유도한다.

ABSTRACT

Legged locomotion is a challenging task for learning algorithms, especially when the task requires a diverse set of primitive behaviors. To solve these problems, we introduce a hierarchical framework to automatically decompose complex locomotion tasks. A high-level policy issues commands in a latent space and also selects for how long the low-level policy will execute the latent command. Concurrently, the low-level policy uses the latent command and only the robot's on-board sensors to control the robot's actuators. Our approach allows the high-level policy to run at a lower frequency than the low-level one. We test our framework on a path-following task for a dynamic quadruped robot and we show that steering behaviors automatically emerge in the latent command space as low-level skills are needed for this task. We then show efficient adaptation of the trained policy to a different task by transfer of the trained low-level policy. Finally, we validate the policies on a real quadruped robot. To the best of our knowledge, this is the first application of end-to-end hierarchical learning to a real robotic locomotion task.

연구 동기 및 목표

  • 다양한 기본 행동이 필요한 복잡한 다리 운동 임무를 수동으로 스킬이나 보상을 설계하지 않고도 학습하는 데 도전하는 것.
  • 종단 간 계층적 훈련을 통해 저수준 정책을 새로운 임무로 효율적으로 이식하는 것.
  • 다른 시간 스케일에서 작동하고 서로 다른 상태 표현을 사용함으로써 고수준 의사결정과 저수준 제어를 분리하는 것.
  • 실제 종복 로봇에서 프레임워크를 검증하여 동적인 환경에서의 강건성과 일반화 능력을 입증하는 것.

제안 방법

  • 두 수준의 계층적 정책 아키텍처를 사용한다: 고수준 정책은 잠재 명령을 내리고 실행 지속 시간을 결정하며, 저수준 정책은 오직 차량 내 센서 데이터만을 사용하여 액추에이터를 제어한다.
  • 고수준 정책은 저수준 정책보다 낮은 주기로 작동하여 상태 갱신 주기와 통신 부담을 분리한다.
  • 잠재 명령 공간은 최대 엔트로피 강화학습을 통해 종단 간으로 학습되며, 사전 정의된 행동 없이 저수준 스킬의 자동 발견이 가능하다.
  • 저수준 정책은 전진 거리와 조향 정확도를 고려한 조밀한 보상 함수로 훈련되며, 과적합을 방지하기 위해 보상의 상한선이 설정된다.
  • 이 프레임워크는 이식 학습을 지원한다: 훈련된 저수준 정책은 새로운 임무에 재사용되어 신속한 적응이 가능하다.
  • 운동 캡처 데이터는 저주파수에서 고수준 상태 추정에 사용되며, 저수준 제어는 고주파수의 자이로스코프 및 관절 피드백을 사용한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 프레임워크는 기본 행동이나 보상 설계 없이 종복 보행을 위한 저수준 운동 기술을 자동으로 발견할 수 있는가?
  • RQ2경로 추종 임무에서 잠재 명령 공간이 자연스럽게 잠재적 조향 행동을 지원하는가?
  • RQ3훈련된 저수준 정책은 최소한의 재훈련으로 새로운 보행 임무에 효과적으로 이식될 수 있는가?
  • RQ4계층적 정책은 실제 종복 로봇에 성공적으로 구현되어 안정적이고 강건한 성능을 보일 수 있는가?

주요 결과

  • 훈련 과정에서 잠재 명령 공간 내에서 자동으로 조향 행동이 유도되며, 이는 회전에 대한 명시적 보상 설계 없이도 곡선 경로를 따라가도록 한다.
  • 전이 학습을 통해 훈련된 저수준 정책는 새로운 경로 추종 임무에 빠른 적응을 이끌어내어 훈련 시간을 크게 단축시킨다.
  • 계층적 정책는 실제 종복 로봇에 성공적으로 구현되어 하드웨어에서 안정적이고 강건한 보행을 보였다.
  • 사전 정의된 저수준 행동을 사용한 베이스라인과 비교해 본 프레임워크는 종단 간 학습을 통한 스킬 발견의 우수성을 입증했다.
  • 고수준 정책는 저수준 정책보다 낮은 주기로 작동하여 통신 및 처리 부담을 줄였지만 성능은 유지했다.
  • 이 방법은 각 수준에 대해 별개의 상태 표현을 사용함으로써, 단일 임무에서 훈련된 경우에도 재사용 가능한 저수준 스킬의 임무에 종속되지 않는 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.