Skip to main content
QUICK REVIEW

[논문 리뷰] Feedback Control For Cassie With Deep Reinforcement Learning

Zhaoming Xie, Glen Berseth|arXiv (Cornell University)|2018. 03. 15.
Robotic Locomotion and Control참고 문헌 18인용 수 21
한 줄 요약

이 논문은 실제 MuJoCo 시뮬레이션을 사용하여 Cassie 이족 보행 로봇을 위한 강건하고 모델-무관(feedback) 제어기를 훈련하기 위한 딥 강화학습(DRL) 프레임워크를 제안한다. 암시 학습을 마르코프 결정 과정(MDP)으로 공식화함으로써, 이 방법은 다양한 속도에서 기준 운동을 추적하는 제어기를 학습하며, 감각 지연, 불규칙한 지형, 큰 외부 힘에 대한 강건성을 입증한다. 정규화된 정책을 통해 가속도 제어가 가능한 적응형 보행 속도 제어를 가능하게 한다.

ABSTRACT

Bipedal locomotion skills are challenging to develop. Control strategies often use local linearization of the dynamics in conjunction with reduced-order abstractions to yield tractable solutions. In these model-based control strategies, the controller is often not fully aware of many details, including torque limits, joint limits, and other non-linearities that are necessarily excluded from the control computations for simplicity. Deep reinforcement learning (DRL) offers a promising model-free approach for controlling bipedal locomotion which can more fully exploit the dynamics. However, current results in the machine learning literature are often based on ad-hoc simulation models that are not based on corresponding hardware. Thus it remains unclear how well DRL will succeed on realizable bipedal robots. In this paper, we demonstrate the effectiveness of DRL using a realistic model of Cassie, a bipedal robot. By formulating a feedback control problem as finding the optimal policy for a Markov Decision Process, we are able to learn robust walking controllers that imitate a reference motion with DRL. Controllers for different walking speeds are learned by imitating simple time-scaled versions of the original reference motion. Controller robustness is demonstrated through several challenging tests, including sensory delay, walking blindly on irregular terrain and unexpected pushes at the pelvis. We also show we can interpolate between individual policies and that robustness can be improved with an interpolated policy.

연구 동기 및 목표

  • 실제 로봇의 역학을 최대로 활용하는 모델-무관, 딥 강화학습 기반 피드백 제어 프레임워크를 개발하는 것.
  • 모델 기반 제어의 한계를 극복하고, Cassie 로봇의 현실적인 시뮬레이션에서 DRL이 강건하고 고성능의 보행 제어기를 생성할 수 있음을 입증하는 것.
  • 물리적으로 비현실적인 운동이라도 시간 조절을 통해 기준 운동을 재정의함으로써 다양한 보행 속도에 대한 제어기를 학습할 수 있도록 하는 것.
  • 다른 속도에서 훈련된 제어기 간의 정책 보간을 통해 제어기의 강건성을 향상시키는 것.
  • 감각 지연, 비정상 지형에서의 막힘 보행, 외부 충격과 같은 도전적인 조건에서 접근 방식을 검증하는 것.

제안 방법

  • 기본 운동을 모방하는 최적의 정책을 학습하는 것을 목표로 피드백 제어 문제를 마르코프 결정 과정(MDP)으로 공식화하는 것.
  • 다층 신경망을 사용해 정책를 매개변수화함으로써 상태 및 기준 궤적 입력에서 제어 행동을 엔드 투 엔드로 학습할 수 있도록 하는 것.
  • 추적 오차 및 안정성 지표에 기반한 희소 밀도 보상 체계를 사용해 정책 그라디언트 강화학습을 통해 정책을 훈련하는 것.
  • 원래 기준 궤적을 시간 스케일링하여 다양한 속도의 기준 운동을 생성함으로써, 발이 미끄러지는 등 물리적으로 비현실적인 운동조차도 가능하게 하는 것.
  • 두 정책의 행동을 파rameter λ에 따라 혼합하여 정책 보간을 구현함으로써 서로 다른 속도의 보행 간의 부드러운 전환을 가능하게 하는 것.
  • 로봇의 현재 속도에 따라 λ를 적응적으로 조정함으로써 경사로에서 자연스럽게 가속하거나 감속할 수 있도록 하는 적응형 보간을 구현하는 것.

실험 결과

연구 질문

  • RQ1딥 강화학습은 단순화된 역학 모델에 의존하지 않고, Cassie와 같은 현실적인 이족 보행 로봇에 대해 강건하고 모델-무관 피드백 제어기를 학습할 수 있는가?
  • RQ2DRL은 발이 미끄러지는 등의 시간 스케일링된 보행과 같은 물리적으로 비현실적인 기준 운동을 추적하는 제어기를 얼마나 효과적으로 학습할 수 있는가?
  • RQ3다른 속도 제어기 간의 정책 보간은 단일 속도 제어기보다 불규칙한 지형에서 더 강건한 성능을 보일 수 있는가?
  • RQ4DRL 기반 제어기는 감각 지연, 막힘 보행, 큰 외부 교란과 같은 실제 세계의 과제를 어느 정도 잘 처리할 수 있는가?
  • RQ5이 프레임워크는 뛰기나 점프와 같은 새로운 기준 운동에 대해 제로샷 적응을 가능하게 할 수 있는가?

주요 결과

  • DRL 기반 제어기는 발이 미끄러지는 등의 물리적으로 비현실적인 운동이 포함된 시간 스케일링된 기준 운동을 훈련한 결과, 다양한 속도에서 보행을 성공적으로 학습하였다.
  • 감각 지연이 최대 100 ms까지 발생하더라도 안정적인 보행을 유지하며 성능 저하가 크게 발생하지 않았다.
  • 불규칙한 지형에서 정책 보간을 통해 고도 0.22 m의 산탄형 지형에서도 안정적인 보행이 가능했으며, 비보간 정책보다 뚜렷한 성능 향상을 보였다.
  • 앞으로 50 N, 뒤로 70 N, 옆으로 15 N의 외부 힘에 견디며 강력한 외부 교란 제거 성능을 보였다.
  • 보간된 정책을 통해 경사로에서 자연스럽게 가속하거나 감속할 수 있었으며, 추가 훈련 없이도 적응형 보행 제어를 달성하였다.
  • 새로운 기준 운동을 통해 새로운 행동으로의 확장이 가능하여, 다양한 보행 작업에 대한 제로샷 학습 가능성에 대한 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.