Skip to main content
QUICK REVIEW

[논문 리뷰] LAGOON: Language-Guided Motion Control

Shusheng Xu, Huaijie Wang|arXiv (Cornell University)|2023. 06. 18.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

LAGOON은 자연어 명령어에서 물리적으로 현실적인 로봇 동작을 생성하는 다단계 프레임워크이다. 먼저 동작 확산 모델을 사용해 인간의 동작을 생성하고, 이를 시뮬레이션에서 강화학습(RL) 정책을 훈련시켜 이 동작을 모방하도록 한다. 그 후 이 정책을 실제 4족 보행 로봇에 배포한다. 이 방법은 도메인 랜덤라이제이션과 하이브리드 보상 설계를 통해 안정적인 시뮬레이션에서 실제 환경으로의 전이를 달성했으며, "공을 던지다"라는 명령어에 응답해 실제 로봇 강아지가 일어나 앞다리를 흔드는 것을 성공적으로 구현했다.

ABSTRACT

We aim to control a robot to physically behave in the real world following any high-level language command like "cartwheel" or "kick". Although human motion datasets exist, this task remains particularly challenging since generative models can produce physically unrealistic motions, which will be more severe for robots due to different body structures and physical properties. Deploying such a motion to a physical robot can cause even greater difficulties due to the sim2real gap. We develop LAnguage-Guided mOtion cONtrol (LAGOON), a multi-phase reinforcement learning (RL) method to generate physically realistic robot motions under language commands. LAGOON first leverages a pretrained model to generate a human motion from a language command. Then an RL phase trains a control policy in simulation to mimic the generated human motion. Finally, with domain randomization, our learned policy can be deployed to a quadrupedal robot, leading to a quadrupedal robot that can take diverse behaviors in the real world under natural language commands

연구 동기 및 목표

  • 고수준의 자연어 명령어, 예를 들어 "뒤집어지기" 또는 "킥"과 같은 것들에 응답해 물리적으로 현실적인 동작을 수행할 수 있도록 로봇을 가능하게 하는 것.
  • 원천 동작이 합성적으로 생성되어 비현실적인 자세나 빠진 프레임을 포함할 수 있는 상황에서 물리적으로 타당한 로봇 동작을 생성하는 데 도전하는 것.
  • 도메인 랜덤라이제이션과 함께 시뮬레이션에서 제어 정책을 훈련하고 실제 4족 로봇에 배포하여 시뮬레이션에서 실제 환경으로의 격차를 메우는 것.
  • 정신적 일치성과 세밀한 동작 모방을 모두 보장하기 위해 악성 보상과 상태 오차 보상의 조합을 포함한 보상 설계를 개발하는 것.
  • 하나의 통합 파이프라인을 사용해 인간형 및 4족 로봇을 포함한 다양한 로봇 형태에 대해 일반화할 수 있도록 하는 것.

제안 방법

  • 먼저, 미리 훈련된 동작 확산 모델(MDM)이 주어진 언어 명령어에서 인간의 동작을 생성한다.
  • 생성된 인간 동작이 로봇 뼈대에 리타겟팅되어 의미적으로 일치하지만 물리적으로 비현실적인 목표 동작이 생성된다.
  • 하이브리드 보상 함수를 사용해 물리 시뮬레이터에서 목표 동작을 모방하도록 강화학습 정책을 훈련시킨다. 이 보상 함수는 악성 보상과 상태 오차 보상을 조합한다.
  • 보상 함수는 정신적 유사도를 평가하는 크리틱 네트워크와 중요한 프레임에서 정확한 일치를 강제하는 상태 오차 성분을 포함한다.
  • 훈련 중에 도메인 랜덤라이제이션을 적용하여 강인성을 향상시키고 시뮬레이션에서 실제 환경으로의 전이를 성공적으로 이룬다.
  • 최종 정책는 실제 4족 로봇에 배포되며, 물리적 안전성과 안정성을 확보하기 위해 상체 리타겟팅만 사용된다.

실험 결과

연구 질문

  • RQ1물리적으로 비현실적인 동작이지만 언어 조건부 동작 확산 모델이 효과적으로 로봇 제어를 위한 목표 동작을 생성하는 데 사용될 수 있는가?
  • RQ2누락된 프레임이나 불가능한 자세를 포함할 수 있는 합성적이고 오류가 있을 수 있는 목표 동작을 모방하도록 강화학습 정책을 어떻게 훈련시킬 수 있는가?
  • RQ3어떤 보상 설계가 로봇 제어의 이mitation 학습에서 높은 수준의 정신적 일치성과 세밀한 동작 정확도를 동시에 달성하는가?
  • RQ4단일 통합 파이프라인을 통해 인간형 및 4족 로봇을 포함한 다양한 로봇 형태에 대해 견고한 제어 정책을 생성할 수 있는가?
  • RQ5도메인 랜덤라이제이션을 사용해 시뮬레이션에서 훈련된 정책가 복잡한 언어 유도 행동을 위한 실제 4족 로봇에 성공적으로 배포될 수 있는가?

주요 결과

  • 4족 로봇은 "사람이 공을 던지다"라는 명령어에 응답해 성공적으로 일어나 앞다리를 흔들었으며, LAGOON 정책의 실제 환경 배포를 입증했다.
  • 절단 실험 결과, 악성 보상과 상태 오차 보상 모두 필수적임을 확인했다. 이 둘 중 하나가 없으면 로봇이 제대로 일어나거나 앞다리를 움직이지 못했다.
  • 하이브리드 초기화 전략 덕분에 로봇가 누워 있는 자세에서 일어나는 것을 학습할 수 있었으며, 이 전략이 없으면 이를 달성할 수 없었다.
  • 이 방법은 여러 리타겟팅 전략에 일반화되었으며, 뒷다리만 사용해 뒷걸음질 움직이거나 팔을 들어 올리며 뒷걸음 질주하는 행동을 가능하게 했다.
  • 정량적 평가에서 LAGOON은 인간형 및 4족 로봇 모두에서 모든 RL 기준보다 동작 통계에서 뛰어난 성능을 보였다.
  • 실제 실험을 통해 도메인 랜덤라이제이션을 사용해 훈련된 정책가 시뮬레이션과 현실 간의 역학 격차에도 불구하고 안정적이고 물리적으로 현실적인 행동을 달성했다고 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.