Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Learning of Control Policies for Robust Quadruped Bounding using Pretrained Neural Networks

Zhicheng Wang, Anqiao Li|arXiv (Cornell University)|2020. 11. 01.
Robotic Locomotion and Control참고 문헌 13인용 수 4
한 줄 요약

이 논문은 사전 훈련된 신경망 정책을 미세조정하여 견고한 4족 보행 제어를 위한 데이터 효율적인 강화학습 프레임워크를 제안한다. 모델 기반 제어기로부터의 모방 학습과 단계 및 접촉 인식 보상 함수 최적화를 통해, 이 방법은 효율적인 DRL 훈련을 가능하게 하며 실제 Jueying Mini 로봇에 직접 구현되어 불규칙한 실내 및 실외 지형에서 안정적인 이동을 달성한다.

ABSTRACT

Bounding is one of the important gaits in quadrupedal locomotion for negotiating obstacles. The authors proposed an effective approach that can learn robust bounding gaits more efficiently despite its large variation in dynamic body movements. The authors first pretrained the neural network (NN) based on data from a robot operated by conventional model based controllers, and then further optimised the pretrained NN via deep reinforcement learning (DRL). In particular, the authors designed a reward function considering contact points and phases to enforce the gait symmetry and periodicity, which improved the bounding performance. The NN based feedback controller was learned in the simulation and directly deployed on the real quadruped robot Jueying Mini successfully. A variety of environments are presented both indoors and outdoors with the authors approach. The authors approach shows efficient computing and good locomotion results by the Jueying Mini quadrupedal robot bounding over uneven terrain.

연구 동기 및 목표

  • 4족 보행 제어 정책을 훈련하는 데 있어 샘플 효율성을 향상시키기 위해.
  • 불규칙한 지형에서 고차원적이고 동적인 운동을 다루는 데 있어 도전 과제를 해결하기 위해.
  • 시뮬레이션에서 학습된 정책을 실제 물리적 로봇에 직접 전이할 수 있도록 하기 위해.
  • 강화학습에서 보상 설계를 통해 보행 대칭성과 주기성을 유지하기 위해.
  • 종래의 엔드 투 엔드 RL 훈련에 비해 훈련 시간과 계산 비용을 줄이기 위해.

제안 방법

  • 4족 로봇에서 전통적인 모델 기반 제어기의 시연 데이터를 사용하여 신경망 정책을 사전 훈련한다.
  • 시뮬레이션 환경에서 사전 훈련된 정책을 딥 강화학습(DRL)을 사용하여 미세조정한다.
  • 접촉 시점과 보행 단계를 명시적으로 보상 함수에 통합하여 대칭성과 주기성을 강제하는 보상 함수를 설계한다.
  • 상태 관측치(신체 자세 및 접촉 상태 포함)를 기반으로 신경망이 관절 토크를 출력하는 피드백 제어 아키텍처를 사용한다.
  • 다양한 지형 변화를 포함한 시뮬레이션 환경에서 정책을 훈련하여 내구성을 향상시킨다.
  • 최종 정책를 도메인 랜덤라이제이션 또는 시뮬레이션에서 실제 세계로의 전이 기법 없이도 실제 Jueying Mini 로봇에 직접 구현한다.

실험 결과

연구 질문

  • RQ1모델 기반 제어기의 시연 데이터를 기반으로 한 사전 훈련이 4족 보행 제어를 위한 DRL 정책 훈련에서 샘플 복잡도를 크게 감소시키는가?
  • RQ2단계 및 접촉 인식 보상 함수는 대칭적이고 주기적인 보행 패턴을 촉진하는 데 얼마나 효과적인가?
  • RQ3시뮬레이션에서 훈련된 정책가 실제 불규칙한 지형에서 얼마나 잘 일반화되는가?
  • RQ4엔드 투 엔드 RL과 사전 훈련 + 미세조정 RL 간의 훈련 효율성 및 내구성 측면에서 성능 격차는 어느 정도인가?
  • RQ5최종 정책가 도메인 랜덤라이제이션 또는 시뮬레이션에서 실제 세계로의 전이 기법 없이도 하드웨어에 직접 구현 가능한가?

주요 결과

  • 사전 훈련 및 미세조정된 정책는 다양한 실내 및 실외 지형에서 Jueying Mini 로봇에서 안정적인 보행을 달성했다.
  • 종래의 엔드 투 엔드 DRL 훈련에 비해 훈련 시간과 샘플 복잡도를 감소시켰다.
  • 접촉 및 단계 감시를 통합한 보상 함수는 보행 주기성과 대칭성을 성공적으로 강제하여 이동 품질을 향상시켰다.
  • 추가적인 시뮬레이션에서 실제 세계로의 적응 단계 없이도 실제 로봇에 성공적으로 구현되었다.
  • 경사와 불규칙한 지면과 같은 지형의 비정상성에 대해 견고성을 보였다.
  • 샘플 효율성과 실제 세계 성능 사이의 균형을 달성하여, 표준 DRL에 비해 훈련 효율성에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.