Skip to main content
QUICK REVIEW

[논문 리뷰] Teach Biped Robots to Walk via Gait Principles and Reinforcement Learning with Adversarial Critics

Kuangen Zhang, Zhimin Hou|arXiv (Cornell University)|2019. 10. 22.
Robotic Locomotion and Control참고 문헌 20인용 수 5
한 줄 요약

이 논문은 인간의 보행 원리를 기반으로 한 보행 보상과 순환 신경망을 통합한 적대적 TD3(ATD3_RNN)를 제안하여 이원형 로봇 보행을 위한 강화학습을 향상시킨다. 누적 보상 추정에서 局부 최소값과 과대추정 오차를 감소시킴으로써, 테스트 보상은 최대 23.5% 향상되었고, 인간-로봇 보행 유사도는 69.23% 향상되었다.

ABSTRACT

Controlling a biped robot to walk stably is a challenging task considering its nonlinearity and hybrid dynamics. Reinforcement learning can address these issues by directly mapping the observed states to optimal actions that maximize the cumulative reward. However, the local minima caused by unsuitable rewards and the overestimation of the cumulative reward impede the maximization of the cumulative reward. To increase the cumulative reward, this paper designs a gait reward based on walking principles, which compensates the local minima for unnatural motions. Besides, an Adversarial Twin Delayed Deep Deterministic (ATD3) policy gradient algorithm with a recurrent neural network (RNN) is proposed to further boost the cumulative reward by mitigating the overestimation of the cumulative reward. Experimental results in the Roboschool Walker2d and Webots Atlas simulators indicate that the test rewards increase by 23.50% and 9.63% after adding the gait reward. The test rewards further increase by 15.96% and 12.68% after using the ATD3_RNN, and the reason may be that the ATD3_RNN decreases the error of estimating cumulative reward from 19.86% to 3.35%. Besides, the cosine kinetic similarity between the human and the biped robot trained by the gait reward and ATD3_RNN increases by over 69.23%. Consequently, the designed gait reward and ATD3_RNN boost the cumulative reward and teach biped robots to walk better.

연구 동기 및 목표

  • 종단간 강화학습을 통한 이원형 로봇에서의 불안정하고 비자연스러운 보행 문제를 해결한다.
  • 강화학습 기반 보행 제어에서 부적절한 보상 설계로 인한 局부 최소값을 극복한다.
  • 누적 보상 추정에서의 과대추정 오차를 감소시켜 정책 학습 효율성을 향상시킨다.
  • 기준 경로를 사용하지 않고도 로봇과 인간의 보행 패턴 간 운동학적 유사성을 향상시킨다.
  • 생체역학적 사전 지식을 딥 강화학습에 통합하는 확장 가능한 데이터 기반 방법을 개발한다.

제안 방법

  • 비자연스러운 운동을 방지하고 정책이 局부 최소값에서 벗어나도록 유도하기 위해 인간 보행 원리를 기반으로 한 보행 보상 $ \hat{r}^g $ 를 설계한다.
  • 딥 강화학습에서 Q-값 과대추정을 줄이기 위해 두 개의 적대적 비평가를 사용하는 ATD3_RNN을 제안한다.
  • 상태-행동 시퀀스의 시간적 의존성을 모델링하기 위해 비평가에 순환 신경망(RNN)을 통합한다.
  • 두 비평가의 Q-값을 평균내어 학습 안정성 향상과 과대추정 편향 감소를 도모한다.
  • 보행 보상 $ \hat{r}^g $ 와 기본 밀도 보상 $ r^d $ 를 조합하여 학습을 위한 복합 보상 신호를 구성한다.
  • 성능 평가를 위해 시뮬레이션 환경(Roboschool Walker2d 및 Webots Atlas)에서 TD3, ATD3, ATD3_RNN 변종을 사용해 정책을 훈련시킨다.

실험 결과

연구 질문

  • RQ1인간 보행 원리에 기반한 보상 설계가 비자연스러운 보행을 줄이고 학습된 이원형 로봇 보행의 자연스러움을 향상시키는가?
  • RQ2기본 TD3와 DDPG에 비해 ATD3_RNN 알고리즘이 누적 보상 추정에서 과대추정 오차를 얼마나 줄이는가?
  • RQ3비평가에 RNN을 통합함으로써 시간적 책임 할당과 이원형 로봇 보행 정책 성능은 어떻게 향상되는가?
  • RQ4기준 경로를 사용하지 않을 때 제안된 방법이 로봇과 인간의 보행 패턴 간 운동학적 유사성을 얼마나 향상시키는가?
  • RQ5보행 보상과 ATD3_RNN의 조합이 기준 강화학습 방법에 비해 더 높은 테스트 보상과 더 견고한 보행을 제공하는가?

주요 결과

  • 기본 보상만을 사용한 경우에 비해, 보행 보상 $ \hat{r}^g $ 는 Roboschool Walker2d에서 테스트 보상을 23.50% 향상시키고, Webots Atlas에서는 9.63% 향상시켰다.
  • ATD3_RNN 알고리즘은 Walker2d에서 테스트 보상을 추가로 15.96% 향상시키고, Atlas에서는 12.68% 향상시켰으며, Q-값 추정 오차를 19.86%에서 3.35%로 감소시켰다.
  • ATD3_RNN에 보행 보상을 적용했을 때 인간과 로봇의 보행 간余弦 운동학적 유사도는 TD3에 기본 보상을 사용한 경우에 비해 69.23% 향상되었다.
  • Walker2d 로봇은 ATD3_RNN + $ r^d + \hat{r}^g $ 를 사용했을 때 TD3 + $ r^d $ 와 비교해 보행 유사도를 108.82% 향상시켰다.
  • Atlas 로봇은 제안된 방법을 사용했을 때 69.23% 높은 보행 유사도를 기록하여 인간과 유사한 운동 생성 능력 향상을 입증했다.
  • 보행 보상과 ATD3_RNN의 조합은 기준 TD3에 기본 보상만을 사용한 경우에 비해, Walker2d에서는 43.21%, Atlas에서는 23.53%의 테스트 보상 향상을 이룩했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.