Skip to main content
QUICK REVIEW

[논문 리뷰] Primal Wasserstein Imitation Learning

Robert Dadashi, Léonard Hussenot|arXiv (Cornell University)|2020. 06. 08.
Reinforcement Learning in Robotics참고 문헌 61인용 수 41
한 줄 요약

PWIL은 전문가와 에이전트의 상태-행동 분포 간의 Wasserstein 거리를 프라이멀 형식(primal formulation)으로 최소화하여, 오프라인 보상을 도출하고 시연이 적은 상황에서도 거의 전문가 수준의 모방을 달성하며 minmax 학습 없이 동작합니다.

ABSTRACT

Imitation Learning (IL) methods seek to match the behavior of an agent with that of an expert. In the present work, we propose a new IL method based on a conceptually simple algorithm: Primal Wasserstein Imitation Learning (PWIL), which ties to the primal form of the Wasserstein distance between the expert and the agent state-action distributions. We present a reward function which is derived offline, as opposed to recent adversarial IL algorithms that learn a reward function through interactions with the environment, and which requires little fine-tuning. We show that we can recover expert behavior on a variety of continuous control tasks of the MuJoCo domain in a sample efficient manner in terms of agent interactions and of expert interactions with the environment. Finally, we show that the behavior of the agent we train matches the behavior of the expert with the Wasserstein distance, rather than the commonly used proxy of performance.

연구 동기 및 목표

  • 보상 신호를 구체화하기 어렵거나 희박한 경우에도 모방 학습을 동기화합니다.
  • 상태-행동 분포 간의 프라이멀 Wasserstein 거리 를 사용한 원칙적 거리 기반 목표를 제시합니다.
  • 프라이멀 Wasserstein 거리의 상한으로부터 오프라인 보상 함수를 도출하여 학습을 가이드합니다.
  • 연속 제어 과제에서 전문가 행동의 샘플 효율적 회복을 보여주고, 도전적인 Humanoid 시나리오를 포함합니다.
  • 특징 기반 관측과 픽셀 기반(시각) 관측 모두에 적용 가능성을 보여줍니다.

제안 방법

  • 에이전트와 전문가의 실험적 상태-행동 분포 간의 1- Wasserstein 거리를 최소화하는 것을 모방으로 형식화합니다.
  • Wasserstein 거리에 대한 온라인으로 계산 가능한 상한을 얻기 위해 탐욕적 커플링을 도입합니다.
  • 거친 비용 c_i에서 거리에 따라 계산되는 한계 함수를 단조 함수로 하는 에피소드 단위의 이력 의존 보상 r를 정의합니다.
  • 오프라인에서 파생된 보상을 일반 RL 에이전트와 함께 사용하는 PWIL 알고리즘을 제공합니다.
  • 거리를 정의하기 위해 연결된 상태-행동 벡터에 표준화된 유클리드 거리를 사용하고, 필요에 따라 픽셀에서 학습되거나 학습된 거리 d(.)를 사용할 수 있습니다.
  • 대 adversarial IL 방법에서 일반적인 minmax 학습 루프를 피함으로써 확장성과 안정성을 Demonstrate합니다.

실험 결과

연구 질문

  • RQ1PWIL이 MuJoCo 보행 작업에서 시연 수의 변화에 따라 전문가 행동을 회복하는가?
  • RQ2PWIL의 샘플 효율성은 DAC, BC와 같은 최첨단 IL 방법과 비교하여 어느 정도인가?
  • RQ3PWIL은 실제로 전문가와 에이전트의 상태-행동 분포 간의 Wasserstein 거리를 최소화하는가?
  • RQ4MDP 메트릭이 오프라인으로 학습된 경우, PWIL은 시각적/픽셀 기반 관찰에 확장될 수 있는가?
  • RQ5PWIL의 적분 제거(ablation)들이 전문가 행동 재현 능력에 미치는 영향은 무엇인가?

주요 결과

  • PWIL은 Humanoid를 포함한 다수의 MuJoCo 과제에서 단 한 번의 시연으로도 거의 전문가 수준의 성능을 달성합니다.
  • PWIL은 DAC에 비해 대부분의 환경에서 전문가와의 Wasserstein 거리 최소화 측면에서 경쟁력 있거나 우수한 성능을 보이며, 대부분의 경우 거리 감소가 더 가깝습니다.
  • 오프라인에서 파생된 보상 함수는 두 개의 하이퍼파라미터만 필요하고 간단한 보상 공식으로 이점이 있어 튜닝 노력이 줄어듭니다.
  • ABLATION 연구에서 행동 기반 매칭(PWIL-state) 및 적절한 MD 거리 가중치와 같은 구성 요소가 성능에 결정적이며, 전체 전문가 행동 재현을 위해서는 ‘팝아웃(pop-outs)’이 중요합니다.
  • PWIL은 임베딩 공간에서 거리를 학습하여 픽셀 기반 관찰로 확장하는 것을 보여주며(Temporal Cycle-Consistency Learning을 통해) 도어 여는 시나리오에서도 작업 성공을 재현합니다.
  • PWIL은 특히 Humanoid를 의미 있는 점수로 해결하는 데 있어 강한 샘플 효율성을 보이며, 서로 다른 시드와 환경에서도 강건성을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.