Skip to main content
QUICK REVIEW

[논문 리뷰] A CPG-Based Agile and Versatile Locomotion Framework Using Proximal Symmetry Loss

Mohammadreza Kasaei, Miguel Henriques Abreu|arXiv (Cornell University)|2021. 03. 01.
Robotic Locomotion and Control인용 수 5
한 줄 요약

이 논문은 선형 역전된 원추 모델(LIPM) 기반의 폐쇄형 루프 제어와 Proximal Policy Optimization(PPO)를 융합한 하이브리드 CPG 기반의 이동 프레임워크를 제안한다. 이는 새로운 Proximal Symmetry Loss(PSL) 함수를 통해 PPO를 강화한 것으로, 복잡한 지형에서 높은 샘플 효율성과 외란에 대한 강건성을 확보하면서도 인간과 유사한 안정성과 일반화 능력을 갖춘 민첩하고 전방위적인 보행을 가능하게 한다. 학습은 오직 한 가지 시나리오에서만 수행되었음에도 불구하고 시뮬레이션 환경에서 뛰어난 성능을 달성하였다.

ABSTRACT

Humanoid robots are made to resemble humans but their locomotion abilities are far from ours in terms of agility and versatility. When humans walk on complex terrains, or face external disturbances, they combine a set of strategies, unconsciously and efficiently, to regain stability. This paper tackles the problem of developing a robust omnidirectional walking framework, which is able to generate versatile and agile locomotion on complex terrains. The Linear Inverted Pendulum Model and Central Pattern Generator concepts are used to develop a closed-loop walk engine, which is then combined with a reinforcement learning module. This module learns to regulate the walk engine parameters adaptively, and generates residuals to adjust the robot's target joint positions (residual physics). Additionally, we propose a proximal symmetry loss function to increase the sample efficiency of the Proximal Policy Optimization algorithm, by leveraging model symmetries and the trust region concept. The effectiveness of the proposed framework was demonstrated and evaluated across a set of challenging simulation scenarios. The robot was able to generalize what it learned in unforeseen circumstances, displaying human-like locomotion skills, even in the presence of noise and external pushes.

연구 동기 및 목표

  • 인간형 로봇을 위한 강건하고 민첩하며 다용도적인 전방위 보행 프레임워크를 개발하기 위해.
  • 모델의 대칭성을 활용하여 딥 강화학습을 통한 이동 학습의 샘플 효율성을 향상시키기 위해.
  • 적응형 정책 학습을 통해 예측 불가능한 지형과 외부 외란에 일반화할 수 있도록 하기 위해.
  • 분석 기반의 CPG 기반 제어와 모델 자유형 잔여 학습을 통합하여 안정성과 적응 능력을 향상시키기 위해.
  • 제안된 새로운 Proximal Symmetry Loss(PSL) 함수가 PPO 학습을 가속화하는 데 효과적인지를 입증하기 위해.

제안 방법

  • 선형 역전된 원추 모델(LIPM)과 부분 푸리에 급수(PFS) 오scillators를 사용하여 폐쇄형 루프 CPG-ZMP 보행 엔진을 설계하였다.
  • 전문가가 조정한 PD 제어기를 통해 보행 엔진을 안정화시켜 일관된 걸음걸이 생성을 확보하였다.
  • Proximal Policy Optimization(PPO) 에이전트가 보행 엔진의 파라미터를 적응적으로 조정하고 잔여 관절 위치 목표를 생성하도록 학습하였다.
  • 마르코프 결정 과정(MDP) 내의 공간적 및 시간적 대칭성을 활용하여 샘플 효율성을 향상시키기 위해 새로운 Proximal Symmetry Loss(PSL) 함수를 도입하였다.
  • 신뢰 영역 원칙과 대칭 기반 데이터 증강을 통합하여 학습의 안정성과 수렴성을 향상시키는 PSL 함수를 설계하였다.
  • 프레임워크는 시뮬레이션 환경에서 COMAN 인간형 로봇을 대상으로 네 가지 다양한 지형 시나리오에서 평가되었으며, 학습은 오직 한 환경에서만 제한되었다.

실험 결과

연구 질문

  • RQ1하이브리드 CPG 및 딥 강화학습 프레임워크는 복잡한 지형에서 민첩하고 다용도적인 이동을 달성할 수 있는가?
  • RQ2모델의 대칭성을 통합할 경우 PPO 기반의 이동 학습에서 샘플 효율성이 어떻게 향상되는가?
  • RQ3단일 지형에서 학습된 정책이 예측 불가능한 복잡하고 동적인 환경으로 일반화되는 정도는 어느 정도인가?
  • RQ4잔여 물리학 학습은 CPG 기반 보행 엔진의 안정성과 적응 능력을 향상시킬 수 있는가?
  • RQ5제안된 Proximal Symmetry Loss(PSL) 함수는 표준 PPO 및 기존의 대칭 기반 손실 함수보다 샘플 효율성이 뛰어나다고 할 수 있는가?

주요 결과

  • PPO+PSL 프레임워크는 표준 PPO 및 PPO+MSL보다 뛰어난 샘플 효율성을 확보하여 다양한 배치 크기에서 더 빠르게 수렴하고 높은 성능을 유지하였다.
  • 배치 크기가 4,000인 경우 PPO+PSL는 PPO 및 PPO+MSL를 모두 압도하여 대칭 인식 학습의 효과를 입증하였다.
  • 로봇은 재학습 없이도 예측 불가능한 시나리오, 즉 불균형한 지형과 외부 힘의 작용에 대해 학습한 기술을 일반화하여 적용하였다.
  • 외부 힘에 의해 밀리자마자 로봇은 힘의 방향으로 걸음을 딛는 방식으로 회복할 수 있었으며, 이는 사전에 훈련되지 않은 행동이었다.
  • 평균적으로 최고의 모델은 1회 에피소드당 약 29초 동안 400 N의 힘에 견디며, 약 7번의 외부 힘에 저항하였다.
  • 보기와 함께 시뮬레이션 영상에서 인간과 유사한 균형 유지 능력과 안정적인 보행이 가능함을 확인할 수 있었다 (https://youtu.be/mpGYdoPIMo).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.