Skip to main content
QUICK REVIEW

[논문 리뷰] One Policy to Run Them All: an End-to-end Learning Approach to Multi-Embodiment Locomotion

Nico Bohlinger, Grzegorz Czechmanowski|arXiv (Cornell University)|2024. 09. 10.
Sociology and Norbert Elias인용 수 4
한 줄 요약

이 논문은 다리가 달린 로봇의 다양한 형태(4족보행자, 6족보행자, 이족보행자, 인간형 로봇 등)를 동일한 정책으로 제어할 수 있도록 하는 통합형 엔드 투 엔드 딥 강화학습 프레임워크인 URMA를 제안한다. 형태에 관계없이 입력과 출력 표현을 표준화하는 형태 무관형 인코더와 디코더를 사용하며, 시뮬레이션과 실제 세계에서 새로운 로봇 플랫폼으로의 제로샷 전이를 달성하여 재학습 없이도 다양한 형태 변화에 대해 강력한 일반화 성능을 보인다.

ABSTRACT

Deep Reinforcement Learning techniques are achieving state-of-the-art results in robust legged locomotion. While there exists a wide variety of legged platforms such as quadruped, humanoids, and hexapods, the field is still missing a single learning framework that can control all these different embodiments easily and effectively and possibly transfer, zero or few-shot, to unseen robot embodiments. We introduce URMA, the Unified Robot Morphology Architecture, to close this gap. Our framework brings the end-to-end Multi-Task Reinforcement Learning approach to the realm of legged robots, enabling the learned policy to control any type of robot morphology. The key idea of our method is to allow the network to learn an abstract locomotion controller that can be seamlessly shared between embodiments thanks to our morphology-agnostic encoders and decoders. This flexible architecture can be seen as a potential first step in building a foundation model for legged robot locomotion. Our experiments show that URMA can learn a locomotion policy on multiple embodiments that can be easily transferred to unseen robot platforms in simulation and the real world.

연구 동기 및 목표

  • 재학습 없이도 다양한 다리가 달린 로봇 형태를 제어할 수 있는 통합 학습 프레임워크의 부족을 해결하기 위해.
  • 시뮬레이션과 실제 세계에서 새로운 로봇 형태로의 제로샷 배포를 가능하게 하기 위해.
  • 다양한 로봇 플랫폼 간에 크기가 다를 수 있는 관측 및 행동 공간을 처리할 수 있는 형태 무관형 신경망 아키텍처를 개발하기 위해.
  • 다양한 형태 간 지식 전이를 가능하게 하여 다리가 달린 로봇 보행에 대한 기초 모델로 나아가기 위해.
  • 기존 방법들이 각각의 로봇 유형에 맞게 작업 특화 아키텍처와 하이퍼파라미터를 필요로 하는 한계를 극복하기 위해.

제안 방법

  • 다양한 로봇 형태 간에 입력과 출력 표현을 표준화하기 위해 형태 무관형 인코더와 디코더를 갖춘 통합 로봇 형태 아키텍처(URMA)를 도입한다.
  • 동일한 정책이 동시에 16개의 다양한 로봇 플랫폼에서 시뮬레이션 환경에서 학습되는 엔드 투 엔드 다중작업 강화학습 설정을 적용한다.
  • 강화학습 중에 도메인 랜덤라이제이션과 동적 환경 랜덤라이제이션을 사용하여 정책의 강건성을 향상시키고 제로샷 전이를 가능하게 한다.
  • 특정 관절 수와 운동학적 구조에 관계없이 정책이 일반화할 수 있도록 공유된 표현 공간을 도입한다.
  • 공유된 특징 추출기와 작업 특화 헤드를 갖춘 계층적 아키텍처를 사용하며, 어텐션 또는 라우팅 메커니즘을 통해 동적으로 헤드를 적응시킨다.
  • 커리큘럼 학습과 리워드 형상 조정을 적용하여 다양한 복잡한 형태 간의 학습 안정성을 확보한다.
Figure 1: Top – We train a single locomotion policy for multiple robot embodiments in simulation. Bottom – We can transfer and deploy the policy on three real-world platforms by randomizing the embodiments and environment dynamics during training.
Figure 1: Top – We train a single locomotion policy for multiple robot embodiments in simulation. Bottom – We can transfer and deploy the policy on three real-world platforms by randomizing the embodiments and environment dynamics during training.

실험 결과

연구 질문

  • RQ1다른 수의 지느러미와 관절을 가진 다양한 다리가 달린 로봇 형태를 제어할 수 있도록 하나의 딥 강화학습 정책을 학습시킬 수 있는가?
  • RQ2다양한 형태에서 학습된 정책이 미세조정 없이도 완전히 새로운 로봇 플랫폼으로 일반화할 수 있는 정도는 어느 정도인가?
  • RQ3제안된 형태 무관형 아키텍처는 시뮬레이션 및 실제 세계의 로봇에서 제로샷 배포를 얼마나 효과적으로 가능하게 하는가?
  • RQ4공유된 표현 학습이 형태 변화에 따른 정책 일반화 및 샘플 효율성에 어떤 영향을 미치는가?
  • RQ5이 프레임워크는 새로운 플랫폼에 대해 소수의 예시로 적응할 수 있도록 다리가 달린 로봇 보행을 위한 기초 모델로 기능할 수 있는가?

주요 결과

  • URMA 프레임워크는 시뮬레이션 환경에서 4족보행자, 6족보행자, 이족보행자, 인간형 로봇을 포함한 총 16종의 다른 로봇 형태에서 하나의 정책을 성공적으로 학습시켰다.
  • 학습된 정책는 재학습이나 하이퍼파라미터 조정 없이도 두 개의 새로운 시뮬레이션 로봇 플랫폼과 세 대의 실제 세계 로봇에 대해 제로샷 배포를 달성하였다.
  • 정책는 시뮬레이션과 실제 세계 모두에서 다양한 지형과 동적 조건에서도 강력한 보행 성능을 보였다.
  • 형태 무관형 아키텍처는 크기가 다른 관측 및 행동 공간을 원활하게 처리하여 각 로봇 유형에 맞는 아키텍처 재구성의 필요성을 제거하였다.
  • 다양한 형태 간에 안정적이고 효율적인 학습이 이루어졌으며, 새로 시작하여 학습된 작업 특화 정책와 비교해도 성능가 비슷한 성능을 기록하였다.
  • 이 프레임워크는 새로운 플랫폼에 대해 최소한의 적응으로 빠른 배포가 가능한 다리가 달린 로봇 보행을 위한 기초 모델로서 강력한 잠재력을 보였다.
Figure 2: Overview of URMA. Left – Joint observations and descriptions are encoded and combined into a single joint latent vector through an attention head. Bottom center – Feet observations and descriptions are encoded in the same way. Top center – Joint latent, feet latent, and general observation
Figure 2: Overview of URMA. Left – Joint observations and descriptions are encoded and combined into a single joint latent vector through an attention head. Bottom center – Feet observations and descriptions are encoded in the same way. Top center – Joint latent, feet latent, and general observation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.