Skip to main content
QUICK REVIEW

[논문 리뷰] Bipedal Walking Robot using Deep Deterministic Policy Gradient

Arun Kumar, Navneet Paul|arXiv (Cornell University)|2018. 07. 16.
Robotic Locomotion and ControlEngineering참고 문헌 15인용 수 20
한 줄 요약

이 논문은 Gazebo 시뮬레이터에서 딥 디터미니스틱 포리시 그레디언트(DDPG) 강화학습을 통해 훈련된 평면 이족보행 로봇을 제시한다. 이 로봇은 0.83 m/s의 속도로 안정적인 전진 보행을 달성하였으며, 인간의 보행 패턴과 유사한 보행 패턴을 보였다. 로봇은 역학에 대한 사전 지식 없이 시행착오를 통해 학습하였으며, 속도와 안정성을 장려하는 보상 함수를 사용하였다.

ABSTRACT

Machine learning algorithms have found several applications in the field of robotics and control systems. The control systems community has started to show interest towards several machine learning algorithms from the sub-domains such as supervised learning, imitation learning and reinforcement learning to achieve autonomous control and intelligent decision making. Amongst many complex control problems, stable bipedal walking has been the most challenging problem. In this paper, we present an architecture to design and simulate a planar bipedal walking robot(BWR) using a realistic robotics simulator, Gazebo. The robot demonstrates successful walking behaviour by learning through several of its trial and errors, without any prior knowledge of itself or the world dynamics. The autonomous walking of the BWR is achieved using reinforcement learning algorithm called Deep Deterministic Policy Gradient(DDPG). DDPG is one of the algorithms for learning controls in continuous action spaces. After training the model in simulation, it was observed that, with a proper shaped reward function, the robot achieved faster walking or even rendered a running gait with an average speed of 0.83 m/s. The gait pattern of the bipedal walker was compared with the actual human walking pattern. The results show that the bipedal walking pattern had similar characteristics to that of a human walking pattern. The video presenting our experiment is available at https://goo.gl/NHXKqR.

연구 동기 및 목표

  • 이족보행 보행을 위한 강화학습 적용 프레임워크를 개발하는 것.
  • 연속 제어를 위한 딥 디터미니스틱 포리시 그레디언트(DDPG)를 평면 이족보행자에 구현하고 평가하는 것.
  • 로봇이 학습한 보행 패턴을 광학 모션 캡처에서 확보한 실제 인간 보행 데이터와 비교하는 것.
  • 로봇나이지역 또는 환경 역학에 대한 사전 지식 없이도 안정적이고 고속의 보행을 모델-프리 학습 방식으로 학습하는 것.

제안 방법

  • 이족보행자는 SolidWorks로 모델링되어 Gazebo 시뮬레이터에 통합하기 위해 URDF 형식으로 변환되었다.
  • 로봇의 상태공간은 12개의 변수(허리/무릎 관절 각도 및 속도, 선속도, 지면 접촉 여부)로 구성되었으며, 이는 DDPG 에이전트의 입력으로 사용되었다.
  • 행동공간은 허리 및 무릎 관절 토크를 위한 4개의 연속 제어 출력으로 정의되었다.
  • 전진 운동, 안정성, 에너지 효율성을 장려하기 위해 보상 함수를 설계하였으며, 더 빠르고 부드러운 보행일수록 더 높은 보상을 제공하였다.
  • DDPG 알고리즘은 약 41시간 동안 NVIDIA GTX 1050 Ti GPU를 사용하여 리play 버퍼와 타겟 네트워크를 활용해 훈련되었다.
  • ROS는 학습 에이전트와 Gazebo 시뮬레이션 간의 통신 인터페이스로 사용되었으며, 50 Hz의 갱신 주기로 작동하였다.

실험 결과

연구 질문

  • RQ1DDPG는 역학에 대한 사전 지식 없이 물리 기반 시뮬레이션에서 안정적이고 연속적인 이족보행을 성공적으로 학습할 수 있는가?
  • RQ2DDPG로 훈련된 이족보행 로봇의 보행 패턴은 관절 각도 궤적과 단계적 관계 측면에서 인간과 어떻게 비교되는가?
  • RQ3모의 이족보행 로봇에서 고속이고 안정적인 보행을 촉진하는 데 가장 효과적인 보상 형태는 무엇인가?
  • RQ4모델-프리 강화학습은 평면 이족보행 시스템에서 인간과 유사한 보행을 어느 정도 재현할 수 있는가?

주요 결과

  • DDPG로 훈련된 이족보행 로봇은 약 41시간의 훈련 후 10미터를 넘어 넘어지지 않고 안정적인 전진 보행을 달성하였다.
  • 로봇의 평균 보행 속도는 0.83 m/s에 도달하여 효율적이고 역동적인 이동을 보였다.
  • 로봇의 허리 관절 각도 궤적은 약 180도 정도 위상이 반전되어 있으며, 모션 캡처에서 관측된 인간 보행 패턴과 유사하였다.
  • 무릎 관절 각도 주파수는 허리 관절의 약 두 배였으며, 광학 모션 캡처 데이터로 확인된 바와 같이 인간 보행 패턴을 그대로 반영하였다.
  • 로봇의 보행 패턴은 단계적으로 결합된 관절 운동과 부드러운 전환을 보이며 인간 보행과 유사한 특성을 보였다.
  • 시뮬레이션 결과는 DDPG가 연속 행동 공간에서 이족보행의 복잡한 비선형 제어 정책을 효과적으로 학습할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.