Skip to main content
QUICK REVIEW

[논문 리뷰] Imitation Learning from Imperfect Demonstration

Yueh-Hua Wu, Nontawat Charoenphakdee|arXiv (Cornell University)|2019. 01. 27.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 16
한 줄 요약

이 논문은 불완전한 시범 데이터를 활용하여 정책 학습을 향상시키기 위해 신뢰도 점수를 활용하는 두 가지 새로운 이mitation 학습 방법—2IWIL과 IC-GAIL—을 제안한다. 신뢰도 점수를 이용해 트레이젝터리를 재가중하고, 레이블이 없는 데이터를 활용함으로써, 두 방법 모두 기준 모델을 크게 능가하며, IC-GAIL는 수렴 속도가 느리지만 더 뛰어난 성능을 보이며, 최적의 시범 데이터를 확보하는 데 비용이 많이 드는 실제 환경에서도 노이즈가 있는 신뢰도 점수에 대해 뛰어난 내성력을 보인다.

ABSTRACT

Imitation learning (IL) aims to learn an optimal policy from demonstrations. However, such demonstrations are often imperfect since collecting optimal ones is costly. To effectively learn from imperfect demonstrations, we propose a novel approach that utilizes confidence scores, which describe the quality of demonstrations. More specifically, we propose two confidence-based IL methods, namely two-step importance weighting IL (2IWIL) and generative adversarial IL with imperfect demonstration and confidence (IC-GAIL). We show that confidence scores given only to a small portion of sub-optimal demonstrations significantly improve the performance of IL both theoretically and empirically.

연구 동기 및 목표

  • 최적의 정책을 학습하는 데 있어, 최고의 전문가 데이터를 수집하는 데 비용이 많이 들기 때문에 실제 응용에서 흔히 발생하는 불완전한 시범 데이터로부터 최적의 정책을 학습하는 데 도전하는 것.
  • 레이블이 부여된 신뢰도 점수와 레이블이 없는 시범 데이터를 효과적으로 활용하여, 완전한 최적의 트레이젝터리에 의존하는 것을 줄이는 실용적인 이mitation 학습 프레임워크를 개발하는 것.
  • 특히 레이블이 부여된 시범 데이터의 비율이 적을 경우, 시범 품질의 대체 지표로 신뢰도를 통합함으로써 일반화 능력과 내성력을 향상시키는 것.
  • 신뢰도 기반 재가중과 혼합 분포 모델링이 표준 GAIL 및 행동 코딩보다 뛰어난 성능을 낼 수 있음을 검증하는 것—특히 레이블이 제한된 경우에도 성능이 우수함을 입증함.

제안 방법

  • 2IWIL은 레이블이 없는 시범 데이터의 신뢰도 점수를 예측하기 위해 경험적 리스크 최소화를 사용하고, 추정된 신뢰도 기반으로 트레이젝터리를 재가중하여 재가중된 데이터로 GAIL 목표를 최적화한다.
  • 이 방법은 레이블이 있는 데이터와 없는 데이터를 계수 β를 통해 조합함으로써 분산을 최소화하는 리스크 추정기를 제안하여, 희소한 신뢰도 애너테이션을 효율적으로 활용한다.
  • IC-GAIL은 시범 혼합 분포를 최적과 비최적 분포의 조합으로 모델링하고, 비최적 성분으로 재가중하면서 적대적 훈련을 통해 최적의 점유도 측정값을 일치시킨다.
  • 이 방법은 혼합 분포에서 최적 시범의 비율에 따라 의존하는 GAN 기반 목표를 유도하며, 이로써 판별기는 레이블이 부여된 시범 데이터와 레이블이 없는 트레이젝터리 양쪽에서 학습할 수 있다.
  • 두 방법 모두 일반적이고 확장 가능한 설계를 하여, GAIL과 같은 기존의 IRL 및 IL 프레임워크와 호환되며, 다양한 손실 함수, 모델, 최적화 방법에 쉽게 적용 가능하도록 설계되었다.
  • 이 프레임워크는 레이블이 부여된 시범 데이터의 비율이 매우 낮다는 가정 하에 설계되었으며, 이는 전체 전문가 애너테이션이 비현실적인 실제 환경에서 실용적임을 뜻한다.

실험 결과

연구 질문

  • RQ1소수의 불완전한 시범 데이터에 대해 신뢰도 점수를 제공할 경우, 표준 방법이 최적의 시범 데이터를 가정하는 것과 비교해 이mitation 학습 성능을 크게 향상시킬 수 있는가?
  • RQ2신뢰도 애너테이션 데이터와 함께 레이블이 없는 시범 데이터를 활용할 경우, 정책 학습 성능과 샘플 효율성에 어떤 영향을 미치는가?
  • RQ3실제 환경에서 인간 레이블러가 제공하는 노이즈가 있거나 정확도가 떨어지는 신뢰도 점수에 대해 제안된 방법이 내성적이었는가?
  • RQ4제한된 신뢰도 데이터가 존재할 경우, 2IWIL과 IC-GAIL 간의 학습 속도와 최종 성능 사이의 상충 관계는 어떠한가?
  • RQ5IC-GAIL의 혼합 분포 모델링이 최적 시범 비율이 낮은 상황에서도 최적의 정책을 효과적으로 복구할 수 있는가?

주요 결과

  • IC-GAIL는 네 가지 벤치마크 환경에서 표준 GAIL 및 재가중된 GAIL을 포함한 모든 기준 모델을 압도적으로 능가하며, 수렴 속도가 느리지만 평균 수익이 더 높게 나타났다.
  • 2IWIL은 Ant-v2 및 Walker2d-v2와 같은 작업에서 특히 신뢰도 정보가 희소한 경우 더 빠른 수렴 속도를 보이며 뛰어난 성능을 달성했다.
  • 같은 총 시범 수를 사용하더라도, GAIL (U+C)는 신뢰도를 무시하기 때문에 제안된 방법들보다 뚜렷이 열등한 성능을 보였으며, 이는 신뢰도 애너테이션의 가치를 확인한다.
  • 2IWIL과 IC-GAIL 모두 신뢰도 점수에 가우시안 노이즈가 존재하더라도 뛰어난 성능 유지를 보이며, 레이블러가 일관되지 않거나 정확도가 떨어지는 점수를 제공하더라도 높은 성능 유지를 유지했다.
  • 레이블이 없는 시범 데이터의 수가 증가할수록 성능이 향상되었으며, 이는 레이블이 없는 데이터가 신뢰도 데이터가 제한된 상황에서 정책 학습에 긍정적인 기여를 한다는 것을 확인한다.
  • HalfCheetah-v2 환경에서 표준 GAIL의 판별기는 局부 최대값에 갇히는 문제가 발생했지만, 제안된 두 방법 모두 신뢰도 기반 재가중으로 이 문제를 완화했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.