Skip to main content
QUICK REVIEW

[논문 리뷰] Imitation Learning by Estimating Expertise of Demonstrators

Mark Beliaev, Andy Y. Shih|arXiv (Cornell University)|2022. 02. 02.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 오프라인 시연에서 여러 시연자들의 상태에 따라 달라지는 전문 수준을 함께 학습하는 새로운 이민 학습 프레임워크인 ILEED를 제안한다. 비지도 전문 수준 추정을 통해 시연자들의 비최적성(부적절성)을 모델링함으로써, ILEED는 베이스라인을 뛰어넘고 최고의 개별 시연자조차도 능가하며, 23개 환경 중 21개에서 최종 보상이 최대 60% 높아졌고, 평균 7% 향상되었다.

ABSTRACT

Many existing imitation learning datasets are collected from multiple demonstrators, each with different expertise at different parts of the environment. Yet, standard imitation learning algorithms typically treat all demonstrators as homogeneous, regardless of their expertise, absorbing the weaknesses of any suboptimal demonstrators. In this work, we show that unsupervised learning over demonstrator expertise can lead to a consistent boost in the performance of imitation learning algorithms. We develop and optimize a joint model over a learned policy and expertise levels of the demonstrators. This enables our model to learn from the optimal behavior and filter out the suboptimal behavior of each demonstrator. Our model learns a single policy that can outperform even the best demonstrator, and can be used to estimate the expertise of any demonstrator at any state. We illustrate our findings on real-robotic continuous control tasks from Robomimic and discrete environments such as MiniGrid and chess, out-performing competing methods in $21$ out of $23$ settings, with an average of $7\%$ and up to $60\%$ improvement in terms of the final reward.

연구 동기 및 목표

  • 표준 이민 학습 알고리즘이 실제 전문 수준에 관계없이 모든 시연자를 동일시한다는 한계를 해결하기 위해.
  • 데이터셋 내에서 최적 행동과 비최적 행동을 구분하기 위해 시연자 신원 정보를 활용하여 이민 학습 성능을 향상시키기 위해.
  • 사전에 진정한 기량 수준을 알지 못한 채, 정책과 상태에 따라 달라지는 시연자 전문 수준을 동시에 학습하는 공동 모델을 개발하기 위해.
  • 비최적 행동을 걸러내고 다양한 시연자 간의 전문 수준을 융합함으로써, 학습된 정책이 최고의 시연자조차도 능가하도록 하기 위해.

제안 방법

  • 정책, 상태 임베딩, 시연자 임베딩, 상태에 따라 달라지는 전문 수준을 매개변수화하는 공동 확률 모델을 도입한다.
  • 전문 수준 ρ는 상태 임베딩과 시연자 임베딩의 함수로 모델링되어, 상태 기반의 시연자 품질 평가가 가능해진다.
  • 최대우도추정을 사용하여 정책과 전문 수준 매개변수를 동시에 최적화함으로써, 반복적인 개선을 통해 둘 다 향상된다.
  • 신경망을 사용하여 상태와 시연자의 표현을 학습함으로써, 다양한 환경과 작업 간의 일반화를 가능하게 한다.
  • 보상 신호가 필요 없이, 상태-행동 쌍과 시연자 신원 정보만을 기반으로 오프라인 시연를 사용해 종합적으로 훈련한다.
  • 개선된 정책 추정치가 상태 및 시연자 임베딩을 향상시키고, 이로 인해 전문 수준 추정이 향상지는 자기지도 학습 성분을 포함한다.

실험 결과

연구 질문

  • RQ1이질적인 시연자가 포함된 데이터셋에서 비지도 전문 수준 추정이 이민 학습 성능 향상에 기여할 수 있는가?
  • RQ2정책과 전문 수준을 동시에 학습하는 공동 모델이 표준 행동 클로닝 및 기타 이민 학습 베이스라인을 능가할 수 있는가?
  • RQ3여러 시연자로부터 혼합된 품질의 시연 데이터를 사용할 때, 모델이 최적 정책을 얼마나 잘 복원할 수 있는가?
  • RQ4특정 상태에서 최고의 시연자조차도 비최적일 경우, 시연자 비최적성 수준이 다양할 때 모델의 성능는 어떻게 변화하는가?

주요 결과

  • ILEED는 테스트한 23개 환경 중 21개에서 모든 베이스라인을 능가하여 다양한 작업에서 일관된 성능 향상을 보였다.
  • 표준 이민 학습 대비 평균 7% 향상된 최종 보상과 가장 도전적인 설정에서는 최대 60% 향상된 성능을 기록했다.
  • 세 명의 시연자가 포함된 다중 기술 환경에서, 비최적성이 높을 경우(β < 0.5) ILEED는 최고의 시연자보다도 뛰어난 정책을 학습했다.
  • β = 1.0일 경우, 모든 시연이 최적일 때 ILEED는 최고 시연자 성능의 89%를 달성하여 강력한 일반화 능력과 강인함을 보였다.
  • 제거 실험에서 상태 임베딩과 시연자 신원 정보가 ILEED 성능에 필수적임을 확인했으며, 각 구성 요소가 최종 결과에 크게 기여했다.
  • 모델는 높은 정확도로 진정한 전문 수준을 추정하여, 데이터에서 의미 있는 비최적성 패턴을 효과적으로 복원할 수 있음을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.