Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamics and Domain Randomized Gait Modulation with Bezier Curves for Sim-to-Real Legged Locomotion

Maurice Rahme, Ian Abraham|arXiv (Cornell University)|2020. 10. 22.
Robotic Locomotion and Control참고 문헌 21인용 수 5
한 줄 요약

이 논문은 다이나믹스와 도메인 랜덤라이제이션을 사용하여 시뮬레이션에서만 관성 측정값을 기반으로 훈련된 정책이 베지에 곡선 기반의 걸음을 조절하는, 시뮬레이션에서 실제 세계로의 강화 학습 프레임워크인 D2-GMBC를 제안한다. 이 정책은 실제 세계의 알려지지 않은 거친 지형을 견고하게 통과할 수 있게 하며, 접촉 센서나 실제 세계에서의 정밀 조정 없이도 비난식 훈련 대비 5.6배 높은 생존 거리와 실제 로봇에서 4.28배 높은 성능을 달성한다.

ABSTRACT

We present a sim-to-real framework that uses dynamics and domain randomized offline reinforcement learning to enhance open-loop gaits for legged robots, allowing them to traverse uneven terrain without sensing foot impacts. Our approach, D$^2$-Randomized Gait Modulation with Bezier Curves (D$^2$-GMBC), uses augmented random search with randomized dynamics and terrain to train, in simulation, a policy that modifies the parameters and output of an open-loop Bezier curve gait generator for quadrupedal robots. The policy, using only inertial measurements, enables the robot to traverse unknown rough terrain, even when the robot's physical parameters do not match the open-loop model. We compare the resulting policy to hand-tuned Bezier Curve gaits and to policies trained without randomization, both in simulation and on a real quadrupedal robot. With D$^2$-GMBC, across a variety of experiments on unobserved and unknown uneven terrain, the robot walks significantly farther than with either hand-tuned gaits or gaits learned without domain randomization. Additionally, using D$^2$-GMBC, the robot can walk laterally and rotate while on the rough terrain, even though it was trained only for forward walking.

연구 동기 및 목표

  • 접촉 감지 없이 모델링되지 않은 거친 지형을 통과할 수 있도록 4족 보행 로봇을 가능하게 하기 위해.
  • 다이나믹스와 지형을 랜덤라이제이션한 시뮬레이션에서 정책을 훈련시켜 보행 로봇의 시뮬레이션-실세계 간 격차를 해소하기 위해.
  • 개방 루프 베지에 곡선 보행을 강화 학습을 통해 개선하여 더 높은 내구성과 적응성 확보하기 위해.
  • 단일 정책을 사용하여 전방, 횡방향, 회전 이동을 모두 가능하게 하되, 전방 이동 훈련만으로도 이를 달성하기 위해.
  • 최소한의 실제 세계 데이터를 사용하여 높은 성능를 달성하고, 도메인 랜덤라이제이션을 통한 시뮬레이션에 의존하기 위해.

제안 방법

  • 12개의 제어 포인트를 사용하여 발 궤적을 정의하는 베지에 곡선 보행 생성기를 사용한다. 이는 τ와 ψ로 매개변수화된다.
  • 증강된 무작위 탐색(ARS)을 통해 훈련된 강화 학습 정책이 관성 측정값만을 사용하여 실시간으로 보행 매개변수(τ, ψ)를 조절한다.
  • 시뮬레이션-실세계 일반화를 향상시키기 위해 다이나믹스(예: 관성, 마찰계수)와 지형 특성(예: 표면 거칠기, 경사도)에 걸쳐 도메인 랜덤라이제이션을 적용한다.
  • 외부 조향 명령을 사용하여 추가 훈련 없이도 횡방향 및 회전 운동을 가능하게 하기 위해 정책을 훈련한다.
  • 앞쪽 왼쪽 다리의 충격 시간을 기반으로 다리 궤적을 동기화하는 단계 고정 클록 메커니즘을 사용하며, 단계 지연을 설정하여 트로팅 보행을 생성한다.
  • 접촉 감지 기술을 완전히 회피하고, 실시간으로 관성 피드백을 통해 보행 매개변수를 조정한다.

실험 결과

연구 질문

  • RQ1도메인 랜덤라이제이션을 적용한 시뮬레이션에서 훈련된 정책이 접촉 감지 없이 실제 세계의 거친 지형으로 일반화될 수 있는가?
  • RQ2다이나믹스와 지형 양쪽을 랜덤라이제이션하는 것이 다이나믹스만 랜덤라이제이션하는 것보다 시뮬레이션-실세계 전이 성능을 향상시키는가?
  • RQ3전방 이동을 위한 훈련만으로도 추가 훈련 없이 횡방향 및 회전 이동을 가능하게 할 수 있는가?
  • RQ4D2-GMBC는 시뮬레이션과 실제 세계 테스트에서 수작업 조정된 보행법과 비난식 학습 기반 방법에 비해 성능 면에서 어떻게 비교되는가?
  • RQ5이 방법은 불균형한 지형에서의 내구성을 확보하면서도 평탄한 지면에서의 전방 속도를 어느 정도 유지하는가?

주요 결과

  • D2-GMBC는 비난식 훈련 기반 대비 시뮬레이션에서 랜덤화된 거친 지형에서 5.6배 높은 생존 거리(≥90m)를 달성했으며, 훈련 중 성능가 더 열 劣한 것으로 나타났다.
  • 실제 로봇에서 D2-GMBC는 수작업 조정된 베지에 보행법보다도 4.28배 더 높은 이동 거리를 확보했으며, 시뮬레이션 메시와 크게 다른 느슨한 돌이 있는 지형에서도 성능을 유지를 하였다.
  • 접촉 감지 없이도 훈련은 전방 이동 전용이었음에도 불구하고, 거친 지형에서 횡방향 이동과 회전을 성공적으로 수행하여 새로운 운동 명령으로의 일반화 능력을 입증하였다.
  • 평탄한 지면에서의 전방 이동 속도를 유지하여, 표준 표면에서의 성능 저하 없이 다방향 이동 성능을 유지를 하였다.
  • 600개 미만의 훈련 에포크 내에 높은 성능를 달성하여 시뮬레이션에서의 데이터 효율성을 입증하였다.
  • 이 프레임워크는 실제 세계에서의 정밀 조정 없이도 직접 시뮬레이션-실세계 배포가 가능하며, 관성 측정값에 의존하고 지형 또는 접촉 감지 기술 없이도 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.