Skip to main content
QUICK REVIEW

[논문 리뷰] TRAIL: Near-Optimal Imitation Learning with Suboptimal Data

Mengjiao Yang, Sergey Levine|arXiv (Cornell University)|2021. 10. 27.
Human Pose and Action Recognition참고 문헌 58인용 수 5
한 줄 요약

TRAIL은 하위 최적의 오프라인 데이터를 활용하여 대비 에너지 기반 전이 모델을 통해 분해된 잠재 행동 공간을 학습하는 이중 단계의 암시 학습 프레임워크를 제안한다. 이는 제한된 전문가 시범 데이터에서 샘플 효율적인 행동 복제를 가능하게 한다. 조건부로 사전 훈련된 데이터가 랜덤 정책과 같은 매우 열악한 수준일지라도, 학습된 동역학 모델을 통해 행동을 재매개변수화함으로써 기존의 암시 학습 방법보다 최대 4배 성능 향상을 달성한다.

ABSTRACT

The aim in imitation learning is to learn effective policies by utilizing near-optimal expert demonstrations. However, high-quality demonstrations from human experts can be expensive to obtain in large numbers. On the other hand, it is often much easier to obtain large quantities of suboptimal or task-agnostic trajectories, which are not useful for direct imitation, but can nevertheless provide insight into the dynamical structure of the environment, showing what could be done in the environment even if not what should be done. We ask the question, is it possible to utilize such suboptimal offline datasets to facilitate provably improved downstream imitation learning? In this work, we answer this question affirmatively and present training objectives that use offline datasets to learn a factored transition model whose structure enables the extraction of a latent action space. Our theoretical analysis shows that the learned latent action space can boost the sample-efficiency of downstream imitation learning, effectively reducing the need for large near-optimal expert datasets through the use of auxiliary non-expert data. To learn the latent action space in practice, we propose TRAIL (Transition-Reparametrized Actions for Imitation Learning), an algorithm that learns an energy-based transition model contrastively, and uses the transition model to reparametrize the action space for sample-efficient imitation learning. We evaluate the practicality of our objective through experiments on a set of navigation and locomotion tasks. Our results verify the benefits suggested by our theory and show that TRAIL is able to improve baseline imitation learning by up to 4x in performance.

연구 동기 및 목표

  • 암시 학습에서 대규모 전문가 시범 데이터를 확보하는 데 드는 높은 비용을 해결하기 위해.
  • 성능이 낮은 하위 최적의 또는 작업에 무관한 오프라인 트레이젝터리가 그다지 좋은 성능을 내지 못하더라도, 후속 암시 학습에 기여할 수 있는지 조사하기 위해.
  • 오프라인 데이터를 사용하여 전문가 암시 학습의 샘플 효율성을 향상시키는 이론적으로 타당한 방법을 개발하기 위해.
  • 시간적 추상화나 계층적 구조에 의존하는 것을 피하고, 제어 효율성을 향상시키기 위해 행동 표현 학습에 집중하기 위해.
  • 전체 전문가 시범 데이터와 오프라인 데이터만을 사용하여 재매개변수화된 잠재 공간에서 행동 복제를 수행할 수 있는 실용적인 알고리즘을 설계하기 위해.

제안 방법

  • TRAIL은 하위 최적의 오프라인 데이터에 대해 대비 손실을 사용하여 훈련된 에너지 기반 모델(EBM)을 사용하여 분해된 전이 모델을 사전 훈련한다.
  • 이 방법은 잠재 행동으로 다시 매핑할 수 있는 쌍체의 행동 디코더를 학습한다. 이를 통해 행동의 재매개변수화가 가능해진다.
  • 학습된 전이 모델과 행동 디코더를 사용하여 전문가 시범 데이터를 잠재 행동 공간으로 재매개변수화한다.
  • 후속 암시 학습은 잠재 공간에서 행동 복제를 통해 최대우도 추정을 사용하여 잠재 정책을 학습함으로써 수행된다.
  • 추론 과정에서는 잠재 정책과 행동 디코더를 조합하여 원래 행동 공간에서의 행동을 생성한다.
  • 이 프레임워크는 EBM 기반 및 선형 전이 모델 변종을 모두 사용하여 구현되었으며, 특정 분해 조건 하에서 샘플 효율성에 이론적 보장이 존재한다.

실험 결과

연구 질문

  • RQ1보상 신호가 없이도 하위 최적의 오프라인 데이터를 사용하여 암시 학습의 샘플 효율성을 향상시킬 수 있는가?
  • RQ2하위 최적의 데이터에서 유도된 분해된 잠재 행동 공간 학습이 후속 암시 학습 성능을 증명 가능하게 향상시키는가?
  • RQ3학습된 전이 모델을 통한 행동 재매개변수화가 시간적 추상화나 계층적 스킬 탐색에 의존하는 방법보다 우수한 성능을 내는가?
  • RQ4랜덤 정책의 트레이젝터리와 같은 저품질 또는 매우 하위 최적의 오프라인 데이터에 대해 이 방법은 얼마나 강건한가?
  • RQ5보상 레이블을 사용하지 않고도 전문가 시범 데이터만으로 제공되는 경우, 이 방법이 보상 레이블을 사용하는 오프라인 RL 방법과 유사한 성능을 달성할 수 있는가?

주요 결과

  • TRAIL은 하위 최적의 데이터로 사전 훈련된 경우조차도 네비게이션 및 이동 작업에서 기존 기준 방법보다 최대 4배 성능 향상을 달성한다.
  • 오프라인 데이터셋을 RL Unplugged 분포의 하위 5%로 줄였을 때도 TRAIL은 일관된 성능 유지를 보이며, 시간적 스킬 추출 방법은 성능이 크게 떨어진다.
  • DeepMind Control Suite 작업에서 TRAIL은 저차원 및 고차원 제어 문제 모두에서 시간적 추상화 기반 방법을 능가한다.
  • 보상 레이블을 전혀 사용하지 않았음에도 불구하고, TRAIL은 6개 작업 중 4개에서 CRR(오프라인 RL 방법)와 유사하거나 뛰어난 성능을 기록한다.
  • 전문가 데이터가 부족할 경우(예: 10,000개 트레이젝터리), 선형 변종이 EBM 변종보다 略으로 더 우수한 성능을 보이며, 결정론적 잠재 정책에 대한 이론적 주장에 대한 지지를 받는다.
  • 이론적 분석 결과, 잠재 행동 공간은 암시 학습의 샘플 복잡도를 감소시키며, 잠재 공간 내에서 시간적 추상화가 없더라도 보장 조건이 유지됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.