Skip to main content
QUICK REVIEW

[논문 리뷰] Shaping Rewards for Reinforcement Learning with Imperfect Demonstrations using Generative Models

Yuchen Wu, Melissa Mozifian|arXiv (Cornell University)|2020. 11. 02.
Reinforcement Learning in Robotics참고 문헌 41인용 수 6
한 줄 요약

이 논문은 불완전한 시연 데이터로부터 상태 및 행동에 따라 변하는 포텐셜을 학습하기 위해 생성 모델—특히 노멀라이징 플로우와 GAN을 사용하는 강화학습를 위한 리워드 형상화 방법을 제안한다. 기존의 방법이 시연를 경계 조건으로 간주하는 반면, 본 방법은 이를 편향 없는 조언으로 간주함으로써, 최적의 시연가 아니거나 노이즈가 있는 경우에도 더 빠르고 데이터 효율적으로 학습할 수 있도록 한다. 이는 시뮬레이션과 실물의 Franka Emika Panda 로봇 암에서 검증되었다.

ABSTRACT

The potential benefits of model-free reinforcement learning to real robotics systems are limited by its uninformed exploration that leads to slow convergence, lack of data-efficiency, and unnecessary interactions with the environment. To address these drawbacks we propose a method that combines reinforcement and imitation learning by shaping the reward function with a state-and-action-dependent potential that is trained from demonstration data, using a generative model. We show that this accelerates policy learning by specifying high-value areas of the state and action space that are worth exploring first. Unlike the majority of existing methods that assume optimal demonstrations and incorporate the demonstration data as hard constraints on policy optimization, we instead incorporate demonstration data as advice in the form of a reward shaping potential trained as a generative model of states and actions. In particular, we examine both normalizing flows and Generative Adversarial Networks to represent these potentials. We show that, unlike many existing approaches that incorporate demonstrations as hard constraints, our approach is unbiased even in the case of suboptimal and noisy demonstrations. We present an extensive range of simulations, as well as experiments on the Franka Emika 7DOF arm, to demonstrate the practicality of our method.

연구 동기 및 목표

  • 모델-자유 강화학습이 실제 로봇 시스템에서 비효율적이고 수렴 속도가 느린 문제를 해결하기 위해.
  • 기존 방법이 최적의 시연를 가정하고 정책 최적화에 경계 조건을 강제하는 한계를 극복하기 위해.
  • 편향 없이 열악한, 노이즈가 있는, 또는 다중 모드의 시연로부터 강인한 정책 학습을 가능하게 하기 위해.
  • 시연를 제약 조건이 아닌 조언으로 간주하는 리워드 형상화 프레임워크를 개발하기 위해.
  • 7DOF 로봇 암에서 페그 삽입 작업을 수행하는 실용적 적용성을 입증하기 위해.

제안 방법

  • 이 방법은 이중 단계 접근 방식을 사용한다: 시연 데이터에 대해 생성 모델(노멀라이징 플로우 또는 GAN)을 오프라인으로 훈련하여 상태-행동 포텐셜 함수 Φ(s,a)를 학습한다.
  • 학습된 포텐셜 함수는 희소 작업 리워드를 형상화하여 탐색을 안내하는 조밀하고 정보가 풍부한 리워드 신호를 생성한다.
  • 리워드 형상화 포텐셜은 최적성을 가정하지 않고 시연에서의 상태와 행동의 공동 분포를 모델링하도록 훈련된다.
  • 온라인 강화학습 단계에서는 TD3에 형상화된 리워드를 사용하며, 포텐셜 함수가 정책이 상태-행동 공간의 고가치 영역으로 향하도록 유도한다.
  • 시연 행동를 직접 강제하지 않기 때문에 정책에 대한 경계 조건을 피함으로써 최적의 해를 찾는 능력을 유지한다.
  • 다중 모드 행동 분포를 모델링함으로써 전체 밀도를 포괄하는 방식으로 다중 모드 행동 분포를 유연하게 처리한다.

실험 결과

연구 질문

  • RQ1생성 모델이 불완전한 시연를 사용하여 강화학습에서 리워드를 효과적으로 형상화할 수 있는가?
  • RQ2열악한 시연가 존재하는 상황에서, 학습된 포텐셜을 사용한 리워드 형상화가 행동 복제나 제약 있는 이mitation 학습보다 우수한가?
  • RQ3이 방법은 고차원 로봇 제어 작업에서 데이터 효율성과 수렴 속도를 향상시킬 수 있는가?
  • RQ4기존 방법과 비교해 볼 때, 노이즈가 있거나 다중 모드의 시연에 대해 이 방법은 얼마나 강인한가?
  • RQ5희소 리워드가 존재하는 실물 로봇 시스템에 이 방법을 성공적으로 구현할 수 있는가?

주요 결과

  • 실제 Franka Emika Panda 로봇 암에서 본 방법은 약 200 에피소드 내로 페그 삽입을 성공적으로 수행하였으며, 표준 TD3보다 뚜렷이 뛰어난 성능을 보였다.
  • 제안된 형상화를 통해 로봇는 최소 20단계 내에 조밀한 누적 리워드를 수집하였으며, 이는 효과적인 초기 탐색과 목표 탐색을 의미한다.
  • λ-가중치 TD3+BC와 달리, 본 방법은 강화학습 및 이mitation 목표의 상대적 가중치에 대한 초모수 튜닝에 민감하지 않다.
  • GAIL은 최적의 시연가 존재하는 경우에도 페그 삽입 작업을 해결하지 못하였으며, 이는 희소 리워드 조건에서 표준 이mitation 학습의 한계를 보여준다.
  • 본 방법은 시연에 존재하는 열악한 행동 양식을 피하는 정책을 성공적으로 학습하였으며, 진정한 최적 해로 향하는 편향 없는 최적화를 유지하였다.
  • 열악하거나 노이즈가 있는 시연에 대해 본 방법은 잊기 스케줄이나 시연 영향력에 대한 수동 초모수 튜닝이 필요 없이 강인함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.