Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling

Yuping Luo, Huazhe Xu|arXiv (Cornell University)|2019. 07. 12.
Reinforcement Learning in Robotics참고 문헌 58인용 수 4
한 줄 요약

이 논문은 악성 샘플링을 통한 값 반복(VINS)을 제안하며, 전문가의 시연 데이터로부터 보수적인 외삽된 가치 함수를 학습시켜 강화학습에서 자기 수정 가능한 정책을 가능하게 한다. 미시도된 상태로의 과도한 낙관적 가치 외삽을 방지하기 위해 악성 샘플링을 사용함으로써, VINS는 샘플 효율성을 향상시키고, 희소 보상이 주어지는 로봇 제어 과제에서 행동 복제와 강화학습 미세조정 모두에서 이전 방법들을 능가한다.

ABSTRACT

Imitation learning, followed by reinforcement learning algorithms, is a promising paradigm to solve complex control tasks sample-efficiently. However, learning from demonstrations often suffers from the covariate shift problem, which results in cascading errors of the learned policy. We introduce a notion of conservatively-extrapolated value functions, which provably lead to policies with self-correction. We design an algorithm Value Iteration with Negative Sampling (VINS) that practically learns such value functions with conservative extrapolation. We show that VINS can correct mistakes of the behavioral cloning policy on simulated robotics benchmark tasks. We also propose the algorithm of using VINS to initialize a reinforcement learning algorithm, which is shown to outperform significantly prior works in sample efficiency.

연구 동기 및 목표

  • 분포 이탈로 인해 정책과 가치 함수가 미시도된 상태로 일반화되지 못하는 이민학습의 공변수 이탈 문제를 해결한다.
  • 실행 중 누적 오류를 유발하는 잘못된 가치 함수 외삽 문제를 해결한다.
  • 시연 경로 근처에 머물도록 유도하기 위해, 시연 집합에 포함되지 않은 상태에 대해 낮은 값을 할당하는 이론적으로 탄탄한 가치 함수 학습 방법을 개발한다.
  • Q함수와 역학 모델을 VINS로 초기화함으로써 강화학습에서 샘플 효율성을 향상시키고, 광범위한 웜업이 필요로 하지 않도록 한다.
  • VINS가 행동 복제 오류를 수정하고, 벤치마크 로봇 제어 과제에서 샘플 효율성 면에서 이전 방법들을 능가할 수 있음을 입증한다.

제안 방법

  • 시연 집합에 포함되지 않은 상태이지만 시연 상태 근처에 있는 상태에 대해 낮은 값을 할당함으로써, 정책의 자기 수정을 장려하는 보수적인 외삽 가치 함수의 개념을 도입한다.
  • 악성 샘플링을 통해 이러한 가치 함수를 학습하는 VINS 알고리즘을 설계하며, 악성 샘플은 시연 상태에 노이즈를 더해 생성된다.
  • 시연 상태에서의 지도 학습과, 시연 집합에 포함되지 않은 변형된 상태에서의 높은 가치를 방지하는 악성 샘플링 손실을 조합한 손실 함수를 제안한다.
  • 다음 상태를 예측하기 위해 시연 경로에서 지도 학습을 사용하여 역학 모델을 학습함으로써, 가치 최대화를 통한 행동 선택을 가능하게 한다.
  • 학습된 가치 함수와 역학 모델을 사용해 강화학습 알고리즘을 초기화함으로써, Q함수 웜업이 광범위하게 필요로 하지 않도록 한다.
  • 시연 데이터에서 벗어나면 정확도가 떨어지는 역학 모델의 경우, 행동 복제 정책의 행동 근처에서 액션을 탐색함으로써 정책의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1미시도된 상태로의 보수적인 가치 함수 외삽을 설계할 수 있을까? 이를 통해 이민학습에서 자기 수정 가능한 정책을 가능하게 할 수 있는가?
  • RQ2어떻게 악성 샘플링을 사용해 시연 데이터에서 멀리 떨어진 영역에서의 과도한 낙관적 예측을 피할 수 있는 가치 함수를 학습할 수 있는가?
  • RQ3VINS로 강화학습 알고리즘을 초기화할 경우, 이전 방법들과 비교해 샘플 효율성이 얼마나 향상되는가?
  • RQ4악성 샘플링, 역학 모델, BC 행동 근처의 액션 탐색 등 각 구성 요소가 VINS의 전체 성능에 기여하는 정도는 어떠한가?
  • RQ5제안된 방법이 희소 보상이 주어지는 로봇 제어 과제에서 행동 복제 정책이 범한 오류를 수정할 수 있는가?

주요 결과

  • VINS는 시뮬레이션된 로봇 제어 과제에서 행동 복제 성능을 크게 향상시켰으며, Pick-100에서 75.7%의 성공률, Push-100에서 55.2%의 성공률을 기록하여 BC만 사용할 경우의 66.8%와 37.3%를 뛰어넘었다.
  • 제거 실험 결과, 악성 샘플링을 제거하면 Pick-100에서 성공률이 48.5%로 떨어지며, 이는 잘못된 외삽을 방지하기 위해 악성 샘플링이 필수적임을 시사한다.
  • 행동 복제 지도 학습 없이 VINS를 적용한 경우 성능이 열악했으며(Pick-100에서 28.5%), 이는 BC 행동이 안정적인 정책 초기화에 필수적임을 보여준다.
  • BC 행동 없이 오라클 역학 모델을 사용해도 Pick-100에서 51.4%의 성공률을 기록하며, 이는 역학 모델의 품질이 핵심적 한계임을 시사한다.
  • RL 초기화에 사용되었을 때, VINS는 이전 최상위 성능 방법(Nair et al., 2018)을 능가하며, 더 적은 환경 상호작용으로 최적에 가까운 성공률에 도달했다.
  • 학습 곡선 분석 결과, VINS로 초기화된 RL은 수렴 속도가 빠르며, 특히 초기 학습 단계에서 높은 성능에 도달하기 위한 샘플 수가 적게 필요한 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.