Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Imitation Learning from Incomplete Demonstrations

Mingfei Sun, Xiaojuan Ma|arXiv (Cornell University)|2019. 05. 29.
Human Pose and Action Recognition참고 문헌 23인용 수 6
한 줄 요약

이 논문은 상태 및 동작 경로를 별도로 처리함으로써 완전한 동작 시퀀스가 아닌 부분적으로 불완전한 동작 시퀀스를 가진 시범으로부터 정책을 학습하는 새로운 알고리즘인 Action-Guided Adversarial Imitation Learning (AGAIL)을 제안한다. AGAIL은 생성자, 판별자 및 가이드 네트워크를 사용하여 상태 분포를 기반으로 정책을 훈련하면서도 가용한 동작을 보조 보상으로 활용하여, 최대 75%의 동작 불완전성 조건에서도 최신 기법들과 비교해 유사한 성능을 달성한다.

ABSTRACT

Imitation learning targets deriving a mapping from states to actions, a.k.a. policy, from expert demonstrations. Existing methods for imitation learning typically require any actions in the demonstrations to be fully available, which is hard to ensure in real applications. Though algorithms for learning with unobservable actions have been proposed, they focus solely on state information and overlook the fact that the action sequence could still be partially available and provide useful information for policy deriving. In this paper, we propose a novel algorithm called Action-Guided Adversarial Imitation Learning (AGAIL) that learns a policy from demonstrations with incomplete action sequences, i.e., incomplete demonstrations. The core idea of AGAIL is to separate demonstrations into state and action trajectories, and train a policy with state trajectories while using actions as auxiliary information to guide the training whenever applicable. Built upon the Generative Adversarial Imitation Learning, AGAIL has three components: a generator, a discriminator, and a guide. The generator learns a policy with rewards provided by the discriminator, which tries to distinguish state distributions between demonstrations and samples generated by the policy. The guide provides additional rewards to the generator when demonstrated actions for specific states are available. We compare AGAIL to other methods on benchmark tasks and show that AGAIL consistently delivers comparable performance to the state-of-the-art methods even when the action sequence in demonstrations is only partially available.

연구 동기 및 목표

  • 기존의 타깃 학습 방법들이 시범에서 완전히 관측 가능한 동작 시퀀스를 요구하는 한계를 해결하기 위해.
  • 완전하지 않은 동작 시퀀스가 포함된 시범에서 효과적으로 부분적으로 이용 가능한 동작 정보를 활용함으로써, 이를 기각하는 대신 활용하기 위해.
  • 전문가 시범에서 동작 정보가 누락되거나 신뢰할 수 없을 경우에도 높은 정책 성능을 유지하기 위해.
  • 적대적 타깃 학습 프레임워크를 훼손하지 않으면서도 동작 유도 보상을 보조 보상 신호로 통합하기 위해.
  • 기준 환경에서 다양한 수준의 동작 불완전성에 대해 강인함을 실증적으로 검증하기 위해.

제안 방법

  • AGAIL은 시범을 상태 경로와 동작 경로로 분해하여 별도로 훈련한다.
  • 정책 그래เดียน트 방법을 통해 정책을 학습하는 생성자를 사용하며, 판별자로부터 제공되는 보상으로 훈련된다.
  • 판별자는 전문가 상태 분포와 생성된 상태 분포를 구별함으로써 적대적 보상을 제공한다.
  • 가이드 네트워크는 가용한 시범 동작(해당 시점에 존재할 경우)과 정책이 생성한 동작 간의 상호정보를 최대화함으로써 추가 보상 신호를 제공한다.
  • 가이드 네트워크는 동작 시퀀스가 부분적으로만 가용할 경우에만 훈련되며, 이는 시범의 완전성 수준에 따라 동적으로 적응할 수 있도록 한다.
  • 프레임워크는 적대적 타깃 학습과 상호정보 최대화를 통합하여 불완전한 데이터로부터의 정책 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1전문가 시범에 누락되거나 불완전한 동작 시퀀스가 포함되어 있을 경우, 타깃 학습이 높은 성능을 달성할 수 있는가?
  • RQ2부분적으로 제공되는 동작 정보를 보조 보상으로 통합할 경우, 순수하게 상태 경로에 의존하는 것과 비교해 정책 학습에 어떤 영향을 미치는가?
  • RQ3제안된 AGAIL 프레임워크는 시범의 동작 불완전성 정도가 다양할 경우에도 강인한가?
  • RQ4불완전한 시범으로 훈련된 경우, AGAIL은 GAIL 및 TRPO와 같은 최신 기법들과 비교해 어떻게 성능을 내는가?
  • RQ5시범의 품질이 동작이 불완전한 타깃 학습 알고리즘의 성능에 어떤 역할을 하는가?

주요 결과

  • AGAIL은 여러 환경에서 GAIL 및 TRPO와 유사한 성능을 보이며, 시범에서 동작의 25%만 가용할 경우에도 일관되게 높은 성능을 달성한다.
  • Hopper 및 Walker2d 환경에서는 AGAIL이 75%의 동작 불완전성 조건에서도 GAIL이 완전한 시범으로 훈련된 성능을 초월한다.
  • Humanoid 환경에서 AGAIL.75는 가장 높은 수익을 기록하여, 부분적인 동작 데이터가 전체이지만 열악한 시범보다 더 효과적일 수 있음을 시사한다.
  • CartPole 및 Hopper 환경에서 높은 동작 완전성 수준(예: AGAIL.00, .25, .50)에서 성능 저하가 발생한 것은, 더 많은 동작 정보를 사용하더라도 열악한 품질의 시범은 학습에 악영향을 미칠 수 있음을 시사한다.
  • 결과는 시범 품질, 특히 동작 분포의 안정성이 학습에 상당한 영향을 미치며, AGAIL가 열악하거나 불완전한 데이터에 대해 강인함을 시사한다.
  • AGAIL는 증가하는 불완전성 비율에 대해 강인함을 보이며, Hopper 및 Humanoid 환경에서 모든 테스트된 불완전성 수준에서 GAIL보다 더 높은 수익을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.