Skip to main content
QUICK REVIEW

[논문 리뷰] From Pixels to Legs: Hierarchical Learning of Quadruped Locomotion

Deepali Jain, Atıl Işçen|arXiv (Cornell University)|2020. 11. 23.
Robot Manipulation and Learning참고 문헌 34인용 수 18
한 줄 요약

이 논문은 원시 픽셀에서부터 다각도 로봇이 동시에 운동 능력과 시각 기반 탐색을 학습할 수 있도록 하는 계층적 강화학습(HRL) 프레임워크를 제안한다. 높은 수준의 시각 처리(1.5–10 Hz)와 낮은 수준의 운동 제어(500 Hz)를 잠재 명령 공간을 통해 분리함으로써, 이 방법은 효율적이고 샘플 효율적인 훈련을 달성하며, 다양한 작업 간에 저수준 정책을 이식 가능하게 하여 비계층적 기준 대비 계산 비용을 줄이고 데이터 효율성을 향상시킨다.

ABSTRACT

Legged robots navigating crowded scenes and complex terrains in the real world are required to execute dynamic leg movements while processing visual input for obstacle avoidance and path planning. We show that a quadruped robot can acquire both of these skills by means of hierarchical reinforcement learning (HRL). By virtue of their hierarchical structure, our policies learn to implicitly break down this joint problem by concurrently learning High Level (HL) and Low Level (LL) neural network policies. These two levels are connected by a low dimensional hidden layer, which we call latent command. HL receives a first-person camera view, whereas LL receives the latent command from HL and the robot's on-board sensors to control its actuators. We train policies to walk in two different environments: a curved cliff and a maze. We show that hierarchical policies can concurrently learn to locomote and navigate in these environments, and show they are more efficient than non-hierarchical neural network policies. This architecture also allows for knowledge reuse across tasks. LL networks trained on one task can be transferred to a new task in a new environment. Finally HL, which processes camera images, can be evaluated at much lower and varying frequencies compared to LL, thus reducing computation times and bandwidth requirements.

연구 동기 및 목표

  • 원시 시각 입력에서 복잡한 환경에서 다각도 로봇이 동적 다리 운동과 시각 기반 탐색을 동시에 학습할 수 있도록 하는 것.
  • 고차원 시각 관측치와 고속의 접촉이 빈번한 다리 역학을 하나의 정책에서 통합하는 데 도전하는 것.
  • 고수준 시각 의사결정과 저수준 운동 제어를 분리하여 데이터 효율성과 훈련 속도를 향상시키는 것.
  • 다양한 탐색 작업과 환경 간에 저수준 정책을 이식함으로써 지식 재사용을 가능하게 하는 것.
  • 고수준 정책을 다양한 낮은 주기로 실행함으로써 성능을 유지하면서 계산 비용을 줄이는 것.

제안 방법

  • 프레임워크는 고수준(HL) 정책이 1인치 카메라 이미지를 처리하고, 저수준(LL) 정책이 잠재 명령에 따라 액추에이터를 제어하는 계층적 아키텍처를 사용한다.
  • HL 네트워크는 저수준 정책의 시간적으로 추상화된 동작으로 사용되는 저차원 잠재 명령(1–8D)을 출력한다.
  • LL 정책는 500 Hz에서 실행되며, 잠재 명령과 차량 내 센서 피드백을 기반으로 모터 명령을 실행한다.
  • HL 정책는 시각 입력을 변동 가능한 낮은 빈도로 처리하도록 설계되어(1.5–10 Hz), 계산 부담을 줄인다.
  • 전체 시스템은 Laikago 로봇의 현실적인 PyBullet 시뮬레이션에서 진화 전략(ES)을 사용해 훈련된다.
  • 잠재 명령 공간은 정보 차단을 형성하여, HL이 관련 시각 특징만 추출하도록 유도하고, LL이 작업에 관련된 운동 프리미티브를 학습하도록 유도한다.

실험 결과

연구 질문

  • RQ1단일 계층적 강화학습 정책이 원시 픽셀에서부터 시각 기반 탐색과 동적 다리 운동을 동시에 학습할 수 있는가?
  • RQ2고수준 시각 처리와 저수준 제어를 분리함으로써 데이터 효율성과 훈련 속도가 향상되는가?
  • RQ3저수준 운동 정책이 다양한 환경과 작업 간에 이식 가능한가?
  • RQ4고수준 정책가 낮고 변동 가능한 주기로 실행되더라도 성능 저하 없이 얼마나 오래 유지될 수 있는가?
  • RQ5잠재 명령 공간에서 부상하는 운동 프리미티브가 의미 있는, 제어 가능한 행동과 대응하는가?

주요 결과

  • 계층적 정책는 세 가지 시각 탐색 작업에서 비계층적 기준 대비 더 높은 샘플 효율성과 더 짧은 월클록 훈련 시간을 달성하여 슈퍼어리어어를 기록했다.
  • 변동 주기 고수준 네트워크(1.5–10 Hz)를 사용한 정책는 매 타임스텝에 고수준 정책를 실행하는 것에 비해 추론 시간을 약 100배 감소시켰다.
  • 2D 잠재 명령 공간이 최적의 성능을 달성하여, 저차원 잠재 공간이 효과적이고 해석 가능하며 이식 가능한 운동 프리미티브를 가능하게 한다는 것을 입증했다.
  • 한 환경(예: 굽은 절벽)에서 훈련된 저수준 정책는 새로운 환경(예: 미로)으로 성공적으로 이식되어 데이터 효율성이 향상되었다.
  • 고수준 정책는 필요할 때만 시각 입력을 처리함으로써 계산과 대역폭 요구량을 줄였지만, 작업 성능을 유지했다.
  • 잠재 명령 공간의 시각화 결과에서, 가속도 조절과 회전 등의 운동 행동 간의 매끄러운 전이가 관찰되어 의미 있고 연속적인 제어 프리미티브가 부상했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.