Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid Internal Model: Learning Agile Legged Locomotion with Simulated Robot Response

Junfeng Long, Zirui Wang|arXiv (Cornell University)|2023. 12. 18.
Robotic Locomotion and Control인용 수 4
한 줄 요약

이 논문은 자이로스코프 및 관절 인코더와 같은 자가감지 센서만을 사용하여 민첩한 다리로 이동하는 데 성공한 학습 기반의 하이브리드 내부 모델(HIM)을 제안한다. 외부 간섭 요소인 지면 마찰력과 고도 변화를 대비하여 대조 학습으로 최적화된 하이브리드 내부 임베딩을 통해 로봇의 속도와 안정성을 표현함으로써, RTX 4090에서 단 1시간의 훈련으로도 외부 시각 인식 없이도 실제 환경에서 오라클 정책을 능가하는 강건하고 일반화 능력이 뛰어난 이동을 달성한다.

ABSTRACT

Robust locomotion control depends on accurate state estimations. However, the sensors of most legged robots can only provide partial and noisy observations, making the estimation particularly challenging, especially for external states like terrain frictions and elevation maps. Inspired by the classical Internal Model Control principle, we consider these external states as disturbances and introduce Hybrid Internal Model (HIM) to estimate them according to the response of the robot. The response, which we refer to as the hybrid internal embedding, contains the robot's explicit velocity and implicit stability representation, corresponding to two primary goals for locomotion tasks: explicitly tracking velocity and implicitly maintaining stability. We use contrastive learning to optimize the embedding to be close to the robot's successor state, in which the response is naturally embedded. HIM has several appealing benefits: It only needs the robot's proprioceptions, i.e., those from joint encoders and IMU as observations. It innovatively maintains consistent observations between simulation reference and reality that avoids information loss in mimicking learning. It exploits batch-level information that is more robust to noises and keeps better sample efficiency. It only requires 1 hour of training on an RTX 4090 to enable a quadruped robot to traverse any terrain under any disturbances. A wealth of real-world experiments demonstrates its agility, even in high-difficulty tasks and cases never occurred during the training process, revealing remarkable open-world generalizability.

연구 동기 및 목표

  • 카메라나 라이다와 같은 외부 센서에 의존하지 않는 강건하고 센서 효율적인 이동 정책을 개발하는 것.
  • 이중 단계의 암시적 학습의 한계, 즉 정보 손실과 시뮬레이션에서 실제 환경으로의 전이 시 노이즈 민감도 문제를 해결하는 것.
  • 배치 수준의 시뮬레이션 정보를 활용하여 샘플 효율성과 노이즈에 대한 강건성을 향상시키는 이동 정책 훈련을 위한 방법을 개발하는 것.
  • 전통적인 내부 모델 제어와 현대적인 딥 강화 학습 간의 연결 고리를 구축하는 것.
  • 최소한의 센서 입력으로도 예측 불가능한 지형과 간섭 요소에 대한 개방형 환경에서의 일반화 능력을 입증하는 것.

제안 방법

  • HIM은 지면 마찰력과 고도와 같은 외부 환경 상태를 시스템의 간섭 요소로 간주하고, 로봇의 시뮬레이션 반응을 통해 이를 추정한다.
  • 자기적 관측 기록에서 유도된 명시적 속도 추적과 암묵적 안정성 모두를 표현하기 위해 대조 학습을 통해 하이브리드 내부 임베딩을 학습한다.
  • 현재 임베딩과 후속 상태 간의 대조 손실을 최소화함으로써 임베딩이 미래의 동역학에 자연스럽게 통합되도록 최적화한다.
  • 정책 네트워크는 자기적 관측과 동적으로 업데이트되는 하이브리드 내부 임베딩을 모두 사용하며, Proximal Policy Optimization(PPO)를 통해 훈련된다.
  • 하이브리드 내부 최적화(HIO)는 각 PPO 반복 단계에서 임베딩을 업데이트하여 정책이 환경 간섭 요소를 암묵적으로 추론하고 구분할 수 있도록 한다.
  • 이 방법은 Isaac Gym 시뮬레이션의 배치 수준 정보를 활용하여 절대적인 환경 매개변수 회귀가 필요 없이도 강건성과 샘플 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1자기감지 센서(IMU 및 관절 인코더)만을 사용하여 외부 시각 인식 없이도 높은 민첩성과 일반화 능력을 갖춘 이동 정책를 달성할 수 있는가?
  • RQ2하이브리드 내부 임베딩의 대조 학습 방식이 환경 상태를 직접 회귀하는 것과 비교해 노이즈에 대한 강건성과 샘플 효율성에서 어떻게 향상되는가?
  • RQ3시뮬레이션에서 훈련된 정책이 훈련 중에 볼 수 없었던 실제 지형과 간섭 요소에 얼마나 잘 일반화되는가?
  • RQ4임베딩 최적화 과정에서 배치 수준의 정보를 사용하는 것이 개별 샘플의 회귀보다 더 나은 일반화 성능을 이끌어내는가?
  • RQ5실제 환경에서 오라클 정책과 암시적 학습 기반 기준선과 비교해 본다면, 제안된 방법은 성능과 강건성 면에서 어떻게 다른가?

주요 결과

  • HIM로 훈련된 정책는 A1 로봇을 이용한 단거리 계단 도전에서 100% 성공률를 기록했으며, 베이스라인(85%)과 속도 입력이 없는 아블레이션(80%)을 모두 능가했다.
  • Aliengo를 사용한 장거리 계단 도전에서는 176.5±7.81단계를 완료했으며, 속도 입력이 없는 아블레이션(51.45±25.67)보다 뚜렷이 뛰어난 성능을 보였다.
  • 예측 불가능한 지형 작업에서, 본 방법은 조합형 지형에서 85%의 성공률를 기록했고, 내부 모델 없이 실험한 경우 70%, 속도 손실 아블레이션 없이 실험한 경우 75%였다.
  • A1에서 방해 요소 테스트 중 최대 10kg의 적재 용량을 달성했으며, 아블레이션들(5kg 이하)에 비해 뛰어난 성능을 보였다.
  • 누락된 계단 도전 과제에서는 100% 성공률를 기록했고, 잠재 입력이 없는 아블레이션은 5%로 떨어졌으며, 회귀 기반 기준선은 완전히 실패(0%)했다.
  • 정책는 단지 2억 개 샘플 내에 수렴했고, RTX 4090에서 단 1시간의 훈련으로도 높은 샘플 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.