Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage

Jonathan Chang, Masatoshi Uehara|arXiv (Cornell University)|2021. 06. 06.
Reinforcement Learning in Robotics참고 문헌 81인용 수 7
한 줄 요약

이 논문은 행동 정책이 매우 열 劣한 경우에도, 전문가 경로의 부분적 커버리지만을 가진 정적 오프라인 데이터셋을 사용하여, 코바리에이트 스플릿을 완화하는 모델 기반 오프라인 타깃 학습 프레임워크인 MILO를 제안한다. 최소한의 전문가 데이터로도 높은 정밀도의 타깃 학습을 달성하며, 행동 클로닝보다 뛰어나 전문가 데이터의 성능의 절반 이하일 때도 전문가 정책을 성공적으로 타깃 학습한다.

ABSTRACT

This paper studies offline Imitation Learning (IL) where an agent learns to imitate an expert demonstrator without additional online environment interactions. Instead, the learner is presented with a static offline dataset of state-action-next state transition triples from a potentially less proficient behavior policy. We introduce Model-based IL from Offline data (MILO): an algorithmic framework that utilizes the static dataset to solve the offline IL problem efficiently both in theory and in practice. In theory, even if the behavior policy is highly sub-optimal compared to the expert, we show that as long as the data from the behavior policy provides sufficient coverage on the expert state-action traces (and with no necessity for a global coverage over the entire state-action space), MILO can provably combat the covariate shift issue in IL. Complementing our theory results, we also demonstrate that a practical implementation of our approach mitigates covariate shift on benchmark MuJoCo continuous control tasks. We demonstrate that with behavior policies whose performances are less than half of that of the expert, MILO still successfully imitates with an extremely low number of expert state-action pairs while traditional offline IL method such as behavior cloning (BC) fails completely. Source code is provided at https://github.com/jdchang1/milo.

연구 동기 및 목표

  • 온라인 환경 상호작용이나 전역적으로 커버링된 전문가 분포가 필요 없이, 타깃 학습에서 코바리에이트 스플릿을 해결하는 것.
  • 행동 정책이 열 劣한 경우에도 작동하는 이론적으로 탄탄한 모델 기반 오프라인 IL 프레임워크를 개발하는 것.
  • 오프라인 데이터에서 전문가 경로의 부분적 커버리지가 성공적인 타깃 학습에 충분한지 입증하는 것.
  • 신경망 앙상블과 디스크리미네이터 기반 비용 함수를 활용해 강건한 오프라인 타깃 학습을 위한 실용적 알고리즘을 제공하는 것.
  • 전문가 데이터가 극히 제한된 환경에서 기존의 오프라인 IL 방법들(예: 행동 클로닝)보다 MILO가 더 뛰어나게 성능을 발휘하는지 보여주는 것.

제안 방법

  • MILO는 상태-행동-다음 상태 전이 데이터로 구성된 정적 오프라인 데이터셋에서 학습된 동역학 모델을 사용해 전문가 유사 롤아웃을 시뮬레이션한다.
  • 랜덤 푸리에 특징을 사용해 전문가 행동과 행동 정책 행동을 구분하는 디스크리미네이터 기반 비용 함수를 적용한다.
  • 예측 분산이 높은 영역에서의 행동을 억제하기 위해 모델 앙상블의 불확실성 기반 페널티 항을 통합한다.
  • 전문가 타깃 학습(디스크리미네이터 손실을 통한)과 행동 클로닝 정규화를 조합한 하이브리드 목표 함수를 사용해 학습을 안정화한다.
  • 신뢰 영역 정책 최적화(TRPO)를 사용해 정책을 최적화하며, KL 발산 제약 조건을 통해 정책 업데이트의 안정성을 확보한다.
  • 전문가 식별과 불확실성 정규화 간의 균형을 조절하는 가속 가능한 페널티 가중치를 통해 비용 함수를 동적으로 조정한다.

실험 결과

연구 질문

  • RQ1행동 정책이 열 劣하고 전문가 상태-행동 쌍을 부분적으로만 커버하는 경우, 오프라인 타깃 학습이 고정밀 타깃 학습을 달성할 수 있는가?
  • RQ2온라인 환경 상호작용이나 상태-행동 공간의 전체 커버리지 없이도 오프라인 IL에서 코바리에이트 스플릿을 완화할 수 있는가?
  • RQ3불확실성 인식 비용 함수를 갖는 모델 기반 접근 방식이 저자료 타깃 학습 환경에서 일반화 성능을 향상시키는가?
  • RQ4전문가 데이터가 극히 제한된 조건에서 MILO가 행동 클로닝 및 기타 오프라인 IL 방법보다 어떻게 비교되는가?
  • RQ5단일 전문가 경로 입력에서도 MILO는 다양한 MuJoCo 연속 제어 환경에서 일반화 성능을 잘 유지할 수 있는가?

주요 결과

  • 행동 정책이 전문가 성능의 46%에 불과한 경우(예: Humanoid-v2에서 1505 ± 473점 대비 3248점)에도 MILO는 전문가 정책을 성공적으로 타깃 학습한다.
  • 단지 100개의 전문가 상태-행동 쌍만으로도 MILO는 전문가 수준의 성능을 달성하지만, 동일한 조건에서 행동 클로닝은 완전히 실패한다.
  • 최소한의 전문가 데이터로도 Hopper, Walker2d, HalfCheetah, Ant, Humanoid 등 모든 MuJoCo 환경에서 MILO가 강력한 성능을 유지한다.
  • 단일 전문가 경로 입력에서도 MILO는 모든 작업에서 전문가 수준 또는 거의 동일한 성능을 달성하며 잘 일반화된다.
  • 불확실성 인식 비용 함수의 사용은 특히 행동 클로닝이 실패하는 저자료 환경에서 강건성을 크게 향상시킨다.
  • Hopper-v2에서의 하이퍼파rameter 튜닝 결과가 다른 환경으로 효과적으로 일반화되어, 이 방법의 이식성과 안정성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.