Skip to main content
QUICK REVIEW

[논문 리뷰] Random Expert Distillation: Imitation Learning via Expert Policy Support Estimation

Ruohan Wang, Carlo Ciliberto|arXiv (Cornell University)|2019. 05. 16.
Explainable Artificial Intelligence (XAI)참고 문헌 27인용 수 17
한 줄 요약

이 논문은 랜덤 인코더를 사용해 전문가 정책의 지지 집합을 추정하고 고정된 내재 보상 함수를 생성함으로써 동적 보상 업데이트 없이 안정적인 이민 학습을 가능하게 하는 새로운 이민 학습 프레임워크인 Random Expert Distillation (RED)을 제안한다. 랜덤 네트워크 디스틸레이션과 오토에인코더의 아이디어를 응용함으로써, RED는 이산적이고 연속적인 제어 과제, 특히 자율 주행과 같은 과제에서 GAIL 및 GMMIL과 같은 최신 기법들과 경쟁하거나 그 이상의 성능을 달성한다.

ABSTRACT

We consider the problem of imitation learning from a finite set of expert trajectories, without access to reinforcement signals. The classical approach of extracting the expert's reward function via inverse reinforcement learning, followed by reinforcement learning is indirect and may be computationally expensive. Recent generative adversarial methods based on matching the policy distribution between the expert and the agent could be unstable during training. We propose a new framework for imitation learning by estimating the support of the expert policy to compute a fixed reward function, which allows us to re-frame imitation learning within the standard reinforcement learning setting. We demonstrate the efficacy of our reward function on both discrete and continuous domains, achieving comparable or better performance than the state of the art under different reinforcement learning algorithms.

연구 동기 및 목표

  • GAIL 및 GMMIL와 같은 적대적 이민 학습 방법의 불안정성과 계산 비용 문제를 해결하기 위해.
  • 전문가 트레이젝터리에서 유도된 강력한 보상 함수를 학습함으로써 행동 복제에서의 누적 오류 문제를 해결하기 위해.
  • 전문가 정책의 지지 집합을 추정하여 동적 보상 업데이트를 피하는 고정된 보상 함수를 정의하기 위해.
  • 학습 중에 강화 학습 신호나 전문가 정책에 접근할 수 없더라도 유한한 수의 전문가 시범 데이터로부터 효과적인 이민 학습을 가능하게 하기 위해.
  • 특히 자율 주행과 같은 고차원 제어 과제에서 표본 효율성과 일반화 능력을 향상시키기 위해.

제안 방법

  • RED는 랜덤 네트워크 디스틸레이션의 영감을 받은 방식으로, 랜덤 인코더가 상태를 잠재 표현으로 매핑함으로써 전문가 정책의 지지 집합을 추정한다.
  • 오토에인코더가 잠재 공간에서 전문가 상태를 재구성하도록 훈련함으로써 전문가의 지지 집합을 압축된 표현으로 학습한다.
  • 잠재 공간에서의 재구성 오차를 고정된 내재 보상 함수로 사용하며, 전문가의 지지 집합 외부의 상태에 대해서는 낮은 보상을 할당한다.
  • 이 보상 함수는 표준 강화 학습 프레임워크 내에서 사용되며, 동적 보상 적응 없이 안정적인 훈련을 가능하게 한다.
  • 전문가의 지지 집합 외부의 상태는 '신규'이므로 높은 재구성 오차로 인해 보상이 감소한다는 아이디어를 활용한다.
  • 이 방법은 GAIL과 상호 보완적이며, 이를 조합함으로써 탐색 능력과 강건성을 향상시킬 수 있다.

실험 결과

연구 질문

  • RQ1전문가 정책의 지지 집합 추정이 적대적 이민 학습의 안정적이고 효과적인 대안이 될 수 있는가?
  • RQ2지지 집합 추정에서 유도된 고정된 보상 함수가 이민 학습에서 동적 보상 함수를 능가할 수 있는가?
  • RQ3지지 기반 보상 형상화는 표본 효율성과 일반화 측면에서 행동 복제 및 역강화 학습과 비교해 어떻게 성과를 내는가?
  • RQ4복잡한 환경, 예를 들어 자율 주행과 같은 환경에서 제한된 전문가 시범 데이터로부터 RED는 어느 정도 일반화할 수 있는가?
  • RQ5RED와 GAIL의 조합은 이민 학습에서 탐색 능력과 훈련 안정성을 향상시킬 수 있는가?

주요 결과

  • 자율 주행 과제에서 RED는 평균 에피소드 보상 4825점을 기록하여 GAIL(795), GMMIL(2024), BC(1033), AE(4378)를 모두 앞서는 성과를 달성했다.
  • HalfCheetah 및 Ant 환경에서는 GAIL 및 GMMIL가 무작위 초기화에서 성능을 내는 데 반해, RED는 행동 복제를 통한 정책 초기화가 필요로 했다.
  • RED는 랜덤 초기화에 대해 강건했으며, AE(1726 대비 1552)보다 표준편차가 낮아 더 안정적인 훈련을 보였다.
  • RED의 보상 함수는 충돌 및 충돌 직전 상태와 같은 위험한 상태를 정확히 보상하여 거의 0에 수렴하는 보상을 할당했다.
  • GAIL은 과적합 문제를 보였으며, 디스크리미네이터 업데이트 후 장애물을 피하는 데 실패하는 경우가 많았다. GMMIL는 일관되지 않은 인cent라이브를 생성했으며, 충돌 이전에 양의 보상을 할당했다.
  • RED의 보상 함수는 전문가 시범과 유사하지 않은 상태를 효과적으로 식별했으며, 실제 세계의 안전 중심 행동과 일치했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.