Skip to main content
QUICK REVIEW

[논문 리뷰] On-Policy Robot Imitation Learning from a Converging Supervisor

Ashwin Balakrishna, Brijen Thananjeyan|arXiv (Cornell University)|2019. 07. 08.
Reinforcement Learning in Robotics참고 문헌 33인용 수 12
한 줄 요약

이 논문은 시간이 지남에 따라 진화하고 수렴하는 지도자(예: 인간 또는 향상되는 알고리즘 기반 제어기)로부터 효율적인 정책 학습을 가능하게 하는 새로운 온정책 일관성 학습 프레임워크를 제안한다. 수렴하는 지도자 하에서의 회귀 한계를 체계적으로 분석하고 이중 정책 반복(DPI)과 연계함으로써, 최신 모델 기반 강화학습보다 정책 평가 속도를 최대 80배 빠르게 하면서도 데이터 효율성을 유지한다. 이는 시뮬레이션 및 물리적 로봇 시스템(예: da Vinci 외과 수술 로봇 포함)에서 검증되었다.

ABSTRACT

Existing on-policy imitation learning algorithms, such as DAgger, assume access to a fixed supervisor. However, there are many settings where the supervisor may evolve during policy learning, such as a human performing a novel task or an improving algorithmic controller. We formalize imitation learning from a "converging supervisor" and provide sublinear static and dynamic regret guarantees against the best policy in hindsight with labels from the converged supervisor, even when labels during learning are only from intermediate supervisors. We then show that this framework is closely connected to a class of reinforcement learning (RL) algorithms known as dual policy iteration (DPI), which alternate between training a reactive learner with imitation learning and a model-based supervisor with data from the learner. Experiments suggest that when this framework is applied with the state-of-the-art deep model-based RL algorithm PETS as an improving supervisor, it outperforms deep RL baselines on continuous control tasks and provides up to an 80-fold speedup in policy evaluation.

연구 동기 및 목표

  • 기존 온정책 일관성 학습 방법이 고정된 지도자를 가정하는 데서 비롯하는 한계를 해결하고자 하며, 이는 인간이나 향상되는 알고리즘이 시간이 지남에 따라 변화하는 실제 세계 상황을 반영하지 못하기 때문이다.
  • 수렴하는 지도자 하에서의 온정책 일관성 학습을 위한 이론적 프레임워크를 체계화하여, 과거 최고의 정책에 대해 하위선형 회귀 보장을 제공하고자 한다.
  • 기존의 이중 정책 반복(DPI) 방법에서의 구조적 가정을 일반화하고 완화함으로써, 일관성 학습과 DPI 간의 격차를 메우고자 한다.
  • 모델 기반 강화학습에서의 정책 평가 속도를 가속화하기 위해, 느리지만 점차 향상되는 지도자(예: PETS)를 신속하고 반응성이 높은 정책으로 정제함으로써 데이터 효율성을 희생하지 않고도 성능을 향상시키고자 한다.
  • 이 방법을 시뮬레이션 및 물리적 da Vinci 외과 수술 로봇에서의 연속 제어 과제에 대해 실증적으로 검증하여, 쿼리 및 평가 시간 측면에서 뚜렷한 속도 향상을 입증하고자 한다.

제안 방법

  • 이 프레임워크는 지도자가 수렴하는 상황에서 정적 및 동적 회귀의 새로운 개념을 도입한다. 여기서 레이블은 학습 중의 중간 지도자로부터 제공되지만, 최종 성능은 수렴한 최종 지도자와 비교한다.
  • 이 방법은 수렴하는 지도자 설정에서의 회귀 분석을 표준 고정 지도자 설정으로 환원함으로써, 약한 가정 하에 하위선형 회귀 보장을 가능하게 한다.
  • 이중 정책 반복(DPI) 유사 루프를 활용한다: 온정책 일관성 학습을 통해 반응성 정책을 훈련하고, 현재 정책의 데이터를 이용해 모델 기반 지도자를 향상시키는 것을 번갈아 수행한다.
  • 지도자는 학습자 분포에서 좋은 정책으로 수렴하는 임의의 알고리즘일 수 있으며, PETS와 같은 딥 모델 기반 강화학습 방법을 포함하지만, 구조적 제약 조건이 필요로 하지 않는다.
  • 반응성 정책는 현재 지도자로부터의 레이블을 사용하여 온정책 일관성 학습(예: DAgger 스타일)으로 훈련되며, 이 지도자는 시간이 지남에 따라 진화한다.
  • 이 프레임워크는 지도자(예: PETS)의 샘플 효율성을 유지하면서도, 신속한 반응성 정책로의 정제를 통해 온라인 추론 비용을 극적으로 감소시킴으로써 데이터 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1지도자가 고정되어 있지 않고 시간이 지남에 따라 수렴하는 상황에서, 온정책 일관성 학습에 대해 이론적 회귀 보장을 제공할 수 있는가?
  • RQ2훈련 중에만 중간 지도자로부터 레이블을 제공받는 상황에서도, 최종 수렴한 지도자에 대해 우수한 성능을 달성할 수 있는가?
  • RQ3제안된 프레임워크는 기존의 이중 정책 반복(DPI) 알고리즘과 어떻게 관련되어 있으며, 그들의 구조적 가정을 완화할 수 있는가?
  • RQ4딥 모델 기반 강화학습에서 정책 평가 속도를 가속화할 수 있는가? 이때 데이터 효율성은 희생되지 않는다.
  • RQ5실제 로봇 시스템에 최신 수준의 지도자(PETS)를 적용했을 때, 이 방법이 추론 속도와 훈련 효율성 측면에서 실질적인 성과를 내는가?

주요 결과

  • 표준 가정 하에, 중간 지도자로부터의 레이블만 제공되더라도, 최고의 과거 정책에 대해 하위선형 정적 및 동적 회귀 보장을 달성한다.
  • PETS를 향상시키는 지도자로 사용할 경우, 이 프레임워크는 PETS의 데이터 효율성을 유지하면서도 시뮬레이션에서 정책 쿼리 시간을 최대 80배 빠르게 한다.
  • 물리적 da Vinci 외과 수술 로봇에서, CSF 학습자는 PETS보다 정책 쿼리 시간을 최대 20배 빠르게 하고 평가 시간을 53% 감소시켰다. 이는 하드웨어 제약으로 인한 최대 제어 주파수 제한에도 불구하고 성립한다.
  • 물리적 로봇에서 단일 및 이중 암 레이저 타스크 모두에서 CSF 학습자는 PETS 지도자를 효과적으로 추적했으며, 뛰어난 일반화 능력과 제어 정밀도를 입증했다.
  • 딥 강화학습 기반선과 비교해 볼 때, 이 방법은 더 빠른 수렴 속도와 뛰어난 샘플 효율성 덕분에 연속 제어 과제에서 뚜렷한 성능 향상을 보였다. 이는 고성능이면서 점차 향상되는 지도자의 정제 덕분이었다.
  • 이 프레임워크는 온라인 추론 비용을 극적으로 감소시킴으로써, 실시간 로봇 시스템에 모델 기반 강화학습 정책를 실용적으로 구현할 수 있도록 한다. 이 과정에서 성능는 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.