Skip to main content
QUICK REVIEW

[논문 리뷰] Data-efficient visuomotor policy training using reinforcement learning and generative models

Ali Ghadirzadeh, Petra Poklukar|arXiv (Cornell University)|2020. 07. 26.
Reinforcement Learning in Robotics참고 문헌 76인용 수 5
한 줄 요약

이 논문은 깊이 있는 시각운동 정책 학습을 위한 데이터 효율적인 강화학습 프레임워크를 제안한다. 이는 잠재변수 기반 생성 모델과 정책 최적화를 통합함으로써 이루어지며, 작업을 행동 잠재변수에 대한 부분 정책 학습, 행동 시퀀스에 대한 비지도 생성 모델 학습, 그리고 엔드 투 엔드 지도 학습 정책 학습으로 분해한다. 이로 인해 데이터 효율성이 최소 한 계단 이상 향상되었으며, 새로운 잠재공간 메트릭을 통해 안전한 탐색과 정책 성능의 예측적 평가가 가능해졌다.

ABSTRACT

We present a data-efficient framework for solving visuomotor sequential decision-making problems which exploits the combination of reinforcement learning (RL) and latent variable generative models. Our framework trains deep visuomotor policies by introducing an action latent variable such that the feed-forward policy search can be divided into three parts: (i) training a sub-policy that outputs a distribution over the action latent variable given a state of the system, (ii) unsupervised training of a generative model that outputs a sequence of motor actions conditioned on the latent action variable, and (iii) supervised training of the deep visuomotor policy in an end-to-end fashion. Our approach enables safe exploration and alleviates the data-inefficiency problem as it exploits prior knowledge about valid sequences of motor actions. Moreover, we provide a set of measures for evaluation of generative models such that we are able to predict the performance of the RL policy training prior to the actual training on a physical robot. We define two novel measures of disentanglement and local linearity for assessing the quality of latent representations, and complement them with existing measures for assessment of the learned distribution. We experimentally determine the characteristics of different generative models that have the most influence on performance of the final policy training on a robotic picking task.

연구 동기 및 목표

  • 강화학습에서 희소 종료 보상 조건 하에서 깊이 있는 시각운동 정책 학습의 데이터 비효율성 문제를 해결하기 위해.
  • 생성 모델을 통해 유효한 행동 시퀀스에 대한 사전 지식를 통합함으로써 탐색 공간을 축소하기 위해.
  • 다양한 행동에 대한 학습된 분포에서만 샘플링함으로써 안전한 탐색을 가능하게 하는 프레임워크를 개발하기 위해.
  • 하류 RL 정책 성능과 상관관계가 있는 생성 모델 품질을 평가할 수 있는 예측적 평가 메트릭을 제공하기 위해.
  • 시각운동 정책 학습에서 데이터 효율성에 가장 큰 영향을 미치는 생성 모델의 핵심 특성들을 규명하기 위해.

제안 방법

  • 정책 학습을 세 단계로 분리하기 위해 잠재 행동 변수 α를 도입함: α에 대한 부분 정책 학습, p_ϑ(τ|α)에 대한 비지도 생성 모델 학습, 그리고 π_Θ(τ|s)에 대한 엔드 투 엔드 지도 학습 정책 학습.
  • EM 알고리즘을 사용하여 부분 정책 π_θ(α|s)와 생성 모델 p_ϑ(τ|α)를 동시에 최적화함. 이때 잠재 변수 α를 EM 프레임워크 내의 잠재 변수로 간주함.
  • 부분 정책 학습에 신뢰역학 영역 정책 최적화(TRPO) 알고리즘을 사용함. 시간적 책임 할당 문제를 피하기 위해 문맥 기반 다중 손잡이 슬롯 문제로 문제를 재정의함.
  • 모델 유형에 맞는 비지도 목적 함수를 사용하여 생성 모델을 훈련함: β-VAEs와 InfoGANs를 활용하여 유효한 운동 궤적의 분포를 포착함.
  • 두 가지 새로운 평가 메트릭을 제안함: 잠재공간 내 분리성의 정밀도와 재현율을 평가하는 분리정밀도(DiP), 분리재현율(DiR), 그리고 생성 과정의 매끄러움을 측정하는 잠재지역선형성(L3).
  • 샘플 품질 평가에 정밀도와 재현율(참고 문헌 [5])을 사용하고, 모든 메트릭을 조합하여 실제 훈련 이전에 RL 정책 성능을 예측함.

실험 결과

연구 질문

  • RQ1생성 모델을 강화학습과 어떻게 통합하여 시각운동 정책 학습의 데이터 효율성을 향상시킬 수 있는가?
  • RQ2생성 모델의 잠재공간 표현에서 하류 RL 정책 학습 성공에 가장 강하게 기여하는 특성들은 무엇인가?
  • RQ3생성 모델의 평가 메트릭만을 사용하여 실제 훈련 이전에 깊이 있는 시각운동 정책의 성능을 어느 정도 예측할 수 있는가?
  • RQ4생성 모델의 잠재공간에서의 분리성과 국소선형성은 정책 학습의 샘플 효율성 향상과 관련이 있는가?
  • RQ5다양한 생성 모델 아키텍처(VAEs 대비 GANs)는 강화학습 정책 최적화 맥락에서 특정한 잠재공간 특성에서 어떤 이점을 얻는가?

주요 결과

  • 모델 유형에 관계없이 생성 모델의 재현율이 성공적인 정책 학습에 가장 큰 영향을 미치며, 이는 다양한 훈련 궤적을 재생산할 수 있는 능력이 핵심임을 시사한다.
  • VAEs의 경우 높은 생성 샘플 정밀도도 중요함을 보여주며, 이는 훈련 데이터에 대한 충실도가 성능 향상에 기여함을 의미한다.
  • GANs의 경우 분리재현율(DiR)이 정책 성공에 중요한 기여를 하며, 이는 다양한 분리된 행동 시퀀스를 생성할 수 있는 능력이 데이터 효율성을 향상시킴을 시사한다.
  • 분리정밀도(DiP)와 잠재지역선형성(L3)은 복잡한 작업에서 구조적인 잠재 표현이 필요한 경우 특히 중요한 메트릭으로 부각됨.
  • ARD 회귀와 피어슨 상관계수 분석을 통해 재현율, DiP, DiR가 정책 성능을 강력하게 예측하는 것으로 확인되었으며, 재현율은 모든 모델 유형에서 일관되게 높은 순위를 차지함.
  • 제안된 평가 프레임워크를 통해 실제 훈련 이전에 RL 정책 성공 여부를 예측할 수 있으며, 이는 잠재공간 품질에 기반한 생성 모델의 정보 기반 선택을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.