Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Agile Skills via Adversarial Imitation of Rough Partial Demonstrations

Chenhao Li, Marin Vlastelica|arXiv (Cornell University)|2022. 06. 23.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 WASABI를 제안하며, 이는 워셔스타인 GAN 기반의 적대적 일관성 학습 방법으로, 물리적으로 불일치하는 부분적이고 불완전한 인간의 시연에서 조랑이 로봇이 복잡한 기술—예를 들어 백플립—을 학습할 수 있도록 한다. 수동으로 캡처한 운동의 상태-행동 전이를 활용한 적대적 훈련을 통해 임의의 작업에 관계없이 보상 함수를 추론함으로써, 시뮬레이션에서 실제 환경으로의 구현이 가능한 안정적이고 고성능의 정책을 도출한다.

ABSTRACT

Learning agile skills is one of the main challenges in robotics. To this end, reinforcement learning approaches have achieved impressive results. These methods require explicit task information in terms of a reward function or an expert that can be queried in simulation to provide a target control output, which limits their applicability. In this work, we propose a generative adversarial method for inferring reward functions from partial and potentially physically incompatible demonstrations for successful skill acquirement where reference or expert demonstrations are not easily accessible. Moreover, we show that by using a Wasserstein GAN formulation and transitions from demonstrations with rough and partial information as input, we are able to extract policies that are robust and capable of imitating demonstrated behaviors. Finally, the obtained skills such as a backflip are tested on an agile quadruped robot called Solo 8 and present faithful replication of hand-held human demonstrations.

연구 동기 및 목표

  • 전문가의 시연이 제공되지 않거나 로봇과 물리적으로 불일치하는 상황에서 매우 동적인 로봇 기술을 학습하는 데 도전하는 것.
  • 수동으로 설계된 보상 함수에 대한 의존도를 줄이기 위해 최소한의 불완전한 시연에서 의미 있는 보상을 추론하는 것.
  • 전문가 정책이나 전체 상태 궤적에 접근하지 못하는 상황에서도 부분적이고 수동으로 캡처한 인간 운동 데이터만으로도 시뮬레이션에서 실제 환경으로의 이행을 가능하게 하는 것.
  • 모드 붕괴를 완화하고 훈련 안정성을 향상시키는 워셔스타인 GAN 설정을 통해 정책의 강건성과 일반화 능력을 향상시키는 것.

제안 방법

  • 전문가 유사 상태-행동 전이와 정책에서 생성된 전이를 구분하는 디스크림이너를 사용하는 워셔스타인 GAN(WASABI) 프레임워크를 사용한다.
  • 디스크림이너의 출력을 보상 신호로 간주하여 강화학습을 통해 정책을 훈련함으로써 전문가 행동에 접근하지 못하는 상황에서도 모방을 가능하게 한다.
  • 디스크림이너의 입력으로 전이 기반 접근을 사용하여 상태-행동 쌍의 시퀀스(H의 수평선)를 활용함으로써 시간적 일관성을 향상시키고 모드 붕괴를 줄인다.
  • 작업에 종속되지 않은 정규화 항목(예: 정지 보상, 속도 추적)을 도입하여 전문가 특화 보상이 없는 상황에서 학습을 안정화시킨다.
  • 비교를 위해 최소 제곱 GAN(LSGAN) 기반 베이스라인을 적용하여, 워셔스타인 설정이 불완전하고 노이즈가 많은 시범 데이터를 처리하는 데 더 뛰어나다는 것을 입증한다.
  • 활동적인 속도 제어와 단일 플립 실행을 위해 관측 공간의 조건부 수정과 보상 형태 조정을 통해 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1생성적 적대적 일관성 학습 방법이 물리적으로 불일치하고 부분적이며 거친 인간 시범 데이터로부터 효과적인 보상 함수를 추론할 수 있는가?
  • RQ2전문가 행동이 없는 상황에서 LSGAN과 워셔스타인 GAN 손실 함수의 선택이 정책 학습 성능과 강건성에 어떤 영향을 미치는가?
  • RQ3부분적 또는 수동으로 캡처한 시범 데이터에서 학습된 정책가 실제로 민첩한 로봇 행동(예: 백플립)으로 일반화되는 정도는 어느 정도인가?
  • RQ4디스크림이너의 관측 수평선(H)이 부분적 시범 데이터를 사용한 일관성 학습에서 정책 수렴과 성능에 어떤 영향을 미치는가?
  • RQ5추가적인 보상 형태 조정(예: 속도 추적, 정지 보상)을 통해 전문가 시범 없이도 운동 지속 시간과 착지 후 안정성을 제어할 수 있는가?

주요 결과

  • WASABI는 물리적으로 불일치하는 손으로 캡처한 부분적 시범 데이터만으로도 조랑이 로봇이 백플립 정책을 성공적으로 학습시켰다.
  • 실제 솔로 8 조랑이 로봇에서 인간 시범의 충실한 복제를 달성하였으며, 동적 시간 왜곡(DTW) 거리 측정을 통해 강력한 궤적 정렬을 보였다.
  • 워셔스타인 GAN 설정을 사용한 정책는 시뮬레이션과 실제 환경 모두에서 LSGAN 기반 베이스라인보다 성능이 뛰어나며, 특히 불완전하거나 노이즈가 많은 시범 데이터 처리에 유리하다.
  • 더 긴 디스크림이너 관측 수평선(H=8)은 정지 및 백플립과 같은 작업에서 정책 수렴과 성능을 향상시키며, 모드 붕괴를 줄이고 시간적 일관성을 향상시킨다.
  • 인간 시범 데이터의 속도 변동성을 활용하여 활성 속도 제어를 성공적으로 달성하였으며, 로봇이 필요에 따라 운동 속도를 조절할 수 있도록 했다.
  • 플립 완료를 감지할 수 있도록 정책의 관측 공간을 수정하고 정지 보상을 적용함으로써 단일 플립 실행을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.