Skip to main content
QUICK REVIEW

[논문 리뷰] A Pragmatic Look at Deep Imitation Learning

Kai Arulkumaran, Dan Ogawa Lillrank|arXiv (Cornell University)|2021. 08. 04.
Reinforcement Learning in Robotics참고 문헌 45인용 수 4
한 줄 요약

이 논문은 공통의 SAC 기반 오프-폴리시 프레임워크와 D4RL MuJoCo 벤치마크를 사용하여 여섯 가지 딥 아이미테이션 러닝 알고리즘—GAIL, AdRIL, BC, 그리고 GMMIL, DRIL, RED의 업데이트된 오프-폴리시 변형—에 대한 공정하고 경험적인 비교를 수행한다. GAIL은 트레이젝터리 예산 전반에서 일관되게 가장 뛰어난 성능을 보였으며, AdRIL은 더 단순한 튜닝으로 강력한 성능을 보였고, 충분한 데이터가 확보된 경우 행동 복제(BC) 역시 매우 경쟁력 있는 성능을 보였다.

ABSTRACT

The introduction of the generative adversarial imitation learning (GAIL) algorithm has spurred the development of scalable imitation learning approaches using deep neural networks. Many of the algorithms that followed used a similar procedure, combining on-policy actor-critic algorithms with inverse reinforcement learning. More recently there have been an even larger breadth of approaches, most of which use off-policy algorithms. However, with the breadth of algorithms, everything from datasets to base reinforcement learning algorithms to evaluation settings can vary, making it difficult to fairly compare them. In this work we re-implement 6 different IL algorithms, updating 3 of them to be off-policy, base them on a common off-policy algorithm (SAC), and evaluate them on a widely-used expert trajectory dataset (D4RL) for the most common benchmark (MuJoCo). After giving all algorithms the same hyperparameter optimisation budget, we compare their results for a range of expert trajectories. In summary, GAIL, with all of its improvements, consistently performs well across a range of sample sizes, AdRIL is a simple contender that performs well with one important hyperparameter to tune, and behavioural cloning remains a strong baseline when data is more plentiful.

연구 동기 및 목표

  • 일관되지 않은 평가 프로토콜, 데이터셋, 알고리즘 선택으로 인해 딥 아이미테이션 러닝 분야에서 공정하고 재현 가능한 비교가 부족한 문제를 해결하기 위해.
  • GAIL, AdRIL 및 기타 알고리즘 포함 여섯 가지 IL 알고리즘을 재구현하고 업데이트하여 오프-폴리시 강화학습(SAC)을 기반으로 일관된 훈련 및 평가가 가능하도록 하기 위해.
  • 모든 방법을 동일한 하이퍼파라미터 최적화 예산과 동일한 전문가 트레이젝터리 데이터셋(D4RL)을 기반으로 여러 MuJoCo 환경에서 평가하기 위해.
  • 실제 데이터 제약 조건과 구현 방식의 다양성 하에서 어떤 IL 방법이 여전히 강건하고 실용적인지 규명하기 위해.
  • 미래의 공정한 벤치마크와 재현 가능성 확보를 위해 통합된 오픈소스 코드베이스를 공개하기 위해.

제안 방법

  • 소프트 액터-크리틱(SAC)을 오프-폴리시 강화학습 알고리즘으로 사용하여 여섯 가지 딥 IL 알고리즘—GAIL, GMMIL, RED, DRIL, AdRIL, PWIL—을 재구현하였다.
  • 세 가지 온-폴리시 IL 방법(GMMIL, RED, DRIL)을 오프-폴리시 설정으로 업데이트하여, SAC 기반 훈련과의 일관된 비교를 가능하게 하였다.
  • MuJoCo 환경에서의 전문가 트레이젝터리 데이터셋인 D4RL를 평가의 표준 벤치마크로 사용하였다.
  • 모든 알고리즘 간의 공정한 비교를 확보하기 위해 공통의 하이퍼파라미터 최적화 예산을 적용하였으며, 각 방법당 50회의 시도를 수행한 베이지안 최적화를 사용하였다.
  • 현재 최선의 실천 방식을 반영하여 결과를 보고: 다수의 랜덤 시드, 평균 및 표준편차, 통계적 유의성 평가를 포함하였다.
  • 훈련 실패 원인을 진단하기 위해 보상 추세와 Q-값을 모니터링하고, 온라인 디스크림ิน레이터 학습 변형을 탐색하였다.

실험 결과

연구 질문

  • RQ1동일한 오프-폴리시 RL 백본(SAC)과 동일한 전문가 데이터셋을 사용하여 동일한 조건에서 훈련된 다양한 딥 아이미테이션 러닝 알고리즘의 성능은 어떻게 되는가?
  • RQ2온-폴리시 IL 알고리즘의 성능은 오프-폴리시 설정으로 전환될 때 떨어지나며, 만약 그렇다면 그 이유는 무엇인가?
  • RQ3트레이젝터리 예산 크기에 따라 하이퍼파라미터 선택(예: 배치 크기, 디스크림ิน레이터 빈도)은 각 IL 방법에서 어떻게 변화하는가?
  • RQ4특히 제한된 전문가 데이터 하에서, 더 단순한 IL 방법인 AdRIL이 더 복잡한 방법인 GAIL에 비해 성능을 동등하거나 초월할 수 있는가?
  • RQ5전문가 데이터가 풍부할 경우 행동 복제(BC)는 어떤 역할을 하는가? 데이터 양 증가에 따라 성능는 어떻게 변화하는가?

주요 결과

  • GAIL은 모든 트레이젝터리 예산에서 일관되게 가장 높은 성능를 기록하였으며, 25개의 트레이젝터리로 HalfCheetah 환경에서 평균 수익이 11,392.09 ± 377.15를 기록하였다.
  • AdRIL은 높은 트레이젝터리 예산(25개)에서 GAIL과 유사한 성능을 보였으며, 5,055.76 ± 64.13의 수익을 기록하였고, 디스크림ิน레이터 업데이트 빈도 하나의 핵심 하이퍼파라미터만 튜닝하면 되었다.
  • 충분한 데이터가 확보된 경우 행동 복제(BC)는 강력한 베이스라인으로 기능하였으며, 25개의 전문가 트레이젝터리가 제공된 경우 몇몇 적대적 IL 방법보다 뛰어난 성능를 보였다.
  • DRIL, GMMIL, RED의 오프-폴리시 버전은 광범위한 하이퍼파라미터 튜닝과 정규화를 거쳐도 수렴하지 못하였으며, 이는 온-폴리시에서 오프-폴리시 훈련으로 전환할 때의 근본적인 불일치를 시사한다.
  • 하이퍼파라미터 튜닝 결과, 배치 크기와 디스크림ิน레이터 크기는 일반적으로 트레이젝터리 예산이 증가함에 따라 증가하는 경향을 보였지만, 이 경향은 일관되지 않았다(예: GAIL의 최적 배치 크기는 더 많은 데이터에서 감소함).
  • 원래의 온-폴리시 버전의 DRIL, GMMIL, RED는 성공적으로 최적화되었으며, 이는 실패 원인이 알고리즘 자체가 아니라 오프-폴리시 적응 과정에 있었음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.