Skip to main content
QUICK REVIEW

[논문 리뷰] Gait Library Synthesis for Quadruped Robots via Augmented Random Search

Sashank Tirumala, Aditya Sagi|arXiv (Cornell University)|2019. 12. 30.
Robotic Locomotion and Control참고 문헌 20인용 수 4
한 줄 요약

이 논문은 증강 랜덤 서치(ARS) 기반 강화학습 방법을 사용하여 각 반단계의 종말 궤적을 학습함으로써 전진 트로트, 후진 트로트, 측면 이동, 회전 등의 사지 보행 라이브러리를 합성한다. 이 방법은 삼차 스퍼링 보간을 사용하는 선형 정책을 활용하여 선형 상태 변환을 통해 효율적인 시뮬레이션에서 실제 환경으로의 전이를 가능하게 하며, 최소한의 계산 부담으로 저비용 하드웨어에서 안정적이고 강건한 이동을 달성한다.

ABSTRACT

In this paper, with a view toward fast deployment of learned locomotion gaits in low-cost hardware, we generate a library of walking trajectories, namely, forward trot, backward trot, side-step, and turn in our custom-built quadruped robot, Stoch 2, using reinforcement learning. There are existing approaches that determine optimal policies for each time step, whereas we determine an optimal policy, in the form of end-foot trajectories, for each half walking step i.e., swing phase and stance phase. The way-points for the foot trajectories are obtained from a linear policy, i.e., a linear function of the states of the robot, and cubic splines are used to interpolate between these points. Augmented Random Search, a model-free and gradient-free learning algorithm is used to learn the policy in simulation. This learned policy is then deployed on hardware, yielding a trajectory in every half walking step. Different locomotion patterns are learned in simulation by enforcing a preconfigured phase shift between the trajectories of different legs. The transition from one gait to another is achieved by using a low-pass filter for the phase, and the sim-to-real transfer is improved by a linear transformation of the states obtained through regression.

연구 동기 및 목표

  • 저비용 임베디드 플랫폼에 적합한 다양한 사지 보행을 생성하기 위한 빠르고 낮은 복잡도의 방법을 개발하기 위해.
  • 실험 데이터로부터 유도된 선형 상태 변환을 사용하여 강화학습에서의 시뮬레이션-실세계 간 격차를 해소하기 위해.
  • 딥 뉴럴 네트워크를 피함으로써 피드백 인식 선형 정책을 통해 실시간으로 외부 간섭에 강건한 행동을 가능하게 하기 위해.
  • 자체 제작한 사지 로봇 스토크 2에서 전진/후진 트로트, 측면 이동, 회전 등의 다양한 보행을 실제 하드웨어에서 구현하기 위해.
  • 최소한의 하이퍼파라미터 튜닝과 낮은 계산 비용으로 효율적인 시뮬레이션-실세계 전이를 달성하기 위해.

제안 방법

  • 선형 정책이 로봇 상태를 종말 궤적의 제어 포인트로 매핑하며, 웨이포인트 간 보간에 삼차 스퍼링을 사용한다.
  • 모델에 의존하지 않고 기울기를 사용하지 않는 강화학습 알고리즘인 증강 랜덤 서치(ARS)를 사용하여 시뮬레이션에서 정책을 최적화한다.
  • 다양한 보행(예: 트로트, 회전, 측면 이동)을 생성하기 위해 다리 궤적 간 단계 이동을 사전 설정한다.
  • 보행 단계에 저역통과 필터를 적용하여 보행 간의 부드러운 전환을 가능하게 한다.
  • 실험적 모터 각도와 시뮬레이션 상태 간의 가중 선형 회귀를 통해 변환 행렬 M̂를 도출하여 시뮬레이션-실세계 불일치를 보정한다.
  • 변환된 정책 ŷ(𝑠) = M̂𝑀𝑠 + M̂𝑏를 사용하여 실제 세계의 추적 성능과 일치하는 제어 포인트를 생성한다.

실험 결과

연구 질문

  • RQ1ARS를 통해 훈련된 선형 정책이 시뮬레이션에서 다양한 안정적인 사지 보행을 생성하고 실제 하드웨어로 효과적으로 전이될 수 있는가?
  • RQ2딥 뉴럴 네트워크를 사용하지 않고도 선형 상태 변환이 사지 보행의 시뮬레이션-실세계 간 격차를 효과적으로 해소하는가?
  • RQ3제안된 방법이 최소한의 계산 부담으로 외부 간섭에 대해 강건하고 자가 보정 가능한 행동을 달성할 수 있는가?
  • RQ4실제 하드웨어에서 궤적 추적 정확도와 보행 안정성 측면에서 제어기의 성능은 어떠한가?
  • RQ5다양한 보행(전진/후진 트로트, 측면 이동, 회전)이 실제 환경 조건에서 얼마나 잘 일반화되고 부드럽게 전이되는가?

주요 결과

  • 선형 변환을 적용한 후 시뮬레이션과 실험적 모터 각도 간 네트워크 상태 오차가 오직 0.01 rad로 매우 작게 유지되었다.
  • 로봇은 실제 하드웨어에서 전진 트로트, 후진 트로트, 측면 이동, 회전을 모두 안정적이고 반복 가능한 성능으로 성공적으로 수행하였다.
  • 외부 간섭 상황에서 관절 각도가 자가 보정 행동을 보이며 선형 정책의 강건성을 확인하였다.
  • 50개의 보행 단계 동안 안정적인 리미트 사이클 행동을 보이며 장기적인 이동 일관성을 입증하였다.
  • 궤적 추적 성능이 높았으며, 그림 7에서 보듯이 모든 보행에서 실제 종말 궤적이 목표 궤적과 매우 유사하게 일치하였다.
  • ARS를 사용한 훈련 시간은 동일 하드웨어에서 딥 강화학습 방법과 유사했으며, 배포된 정책는 최소한의 계산 자원을 요구하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.