Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Experience Replay

Jieliang Luo, Hui Li|arXiv (Cornell University)|2020. 03. 04.
Reinforcement Learning in Robotics참고 문헌 30인용 수 9
한 줄 요약

이 논문은 강화학습 에이전트가 훈련 중에 생성한 성공적인 전이를 인간의 지시와 함께 동적으로 통합함으로써 오프-폴리시 강화학습을 향상시키는 동적 경험 재생(Dynamic Experience Replay, DER) 기법을 소개한다. DER는 샘플 효율성과 훈련 속도를 크게 향상시켜, 펜치-인-홀 및 랩조인과 같은 복잡한 로봇 조립 작업에서 기존의 Ape-X DDPG가 실패하거나 훨씬 느리게 훈련되는 문제를 해결한다.

ABSTRACT

We present a novel technique called Dynamic Experience Replay (DER) that allows Reinforcement Learning (RL) algorithms to use experience replay samples not only from human demonstrations but also successful transitions generated by RL agents during training and therefore improve training efficiency. It can be combined with an arbitrary off-policy RL algorithm, such as DDPG or DQN, and their distributed versions. We build upon Ape-X DDPG and demonstrate our approach on robotic tight-fitting joint assembly tasks, based on force/torque and Cartesian pose observations. In particular, we run experiments on two different tasks: peg-in-hole and lap-joint. In each case, we compare different replay buffer structures and how DER affects them. Our ablation studies show that Dynamic Experience Replay is a crucial ingredient that either largely shortens the training time in these challenging environments or solves the tasks that the vanilla Ape-X DDPG cannot solve. We also show that our policies learned purely in simulation can be deployed successfully on the real robot. The video presenting our experiments is available at https://sites.google.com/site/dynamicexperiencereplay

연구 동기 및 목표

  • 접촉력이 포함된 고정밀 로봇 조립 작업에서 모델-프리 강화학습의 데이터 비효율성 문제를 해결한다.
  • 인간의 지시가 희소하거나 부족한 접촉이 많은 도전적인 환경에서 훈련 효율성을 향상시킨다.
  • 훈련 중에 생성된 성공적인 트레이젝터리를 동적으로 재사용함으로써 정적 인간 지시를 초월한 샘플 효율성 학습을 가능하게 한다.
  • 순수 시뮬레이션에서 훈련된 정책을 실제 로봇 하드웨어에 배포할 수 있는 가능성을 입증한다.
  • 로봇 조립 작업의 다양한 재생 버퍼 구성과 작업 복잡도에서 DER의 영향을 평가한다.

제안 방법

  • 훈련 중에 RL 에이전트가 생성한 성공적인 전이를 동적으로 통합함으로써 경험 재생 버퍼를 보강하는 동적 경험 재생(DER) 기법을 도입한다.
  • 우선순위 기반 경험 재생과 함께 사용 가능한 오프-폴리시 딥 강화학습 알고리즘인 Ape-X DDPG와 결합하여 확장성 있고 분산된 훈련을 가능하게 한다.
  • 클래스 불균형 문제를 완화하기 위해 성공적인 전이(재생 버퍼에서 부족하게 나타나는)를 과도하게 샘플링하는 동적 샘플링 전략을 사용하며, 이는 지도학습에서의 데이터 증강과 유사하다.
  • 상태 입력으로 힘/토크 및 카르테시안 좌표계 위치 관측치를 사용하고, 정확도가 떨어지는 로봇 동역학 모델을 회피하기 위해 6-DOF 카르테시안 속도를 출력으로 사용한다.
  • 고정된 크기(200만 건의 전이)를 가진 재생 버퍼를 유지하며, 이 중 1%(2만 건)는 인간 지시 전이에 할당하고, 나머지 부분은 에이전트가 생성한 전이에 할당한다.
  • α = 0.5로 설정된 우선순위 기반 경험 재생을 적용하고, 학습 안정성을 높이기 위해 절단된 에피소드 샘플링 기법을 사용한다.

실험 결과

연구 질문

  • RQ1인간 지시가 제한된 접촉이 많은 로봇 조립 작업에서 DER이 훈련 효율성을 향상시킬 수 있는가?
  • RQ2펜치-인-홀 및 랩조인 작업에서 DER은 기존의 Ape-X DDPG에 비해 수렴 속도와 최종 성공률 측면에서 어떻게 비교되는가?
  • RQ3DER은 기존의 오프-폴리시 강화학습 알고리즘으로는 해결이 어려운 작업을 학습할 수 있도록 하는가?
  • RQ4DER를 사용해 시뮬레이션에서 훈련된 정책이 실제 산업용 로봇에 성공적으로 배포될 수 있는가?
  • RQ5다양한 재생 버퍼 구성(예: 인간 지시 없음, 모든 버퍼에 동일한 전이 포함)이 DER의 성능에 어떻게 영향을 미치는가?

주요 결과

  • DER는 도전적인 로봇 조립 작업에서 훈련 시간을 크게 감소시키며, 한 구성에서는 기존의 Ape-X DDPG 대비 반의 시간에 성공을 달성한다.
  • 인간 지시 없음 설정에서 DER는 기존의 Ape-X DDPG와 동일한 성공률을 달성하지만 거의 두 배 빠른 속도로 학습함으로써 샘플 효율성이 향상됨을 보여준다.
  • 1mm 이내의 좁은 허용 오차와 둥근 모서리가 없는 랩조인 작업에서는, DER이 네 가지 버퍼 구성 중 두 가지에서 기존의 Ape-X DDPG보다 성공률을 높였다.
  • DER를 사용해 시뮬레이션에서 훈련된 정책은 KUKA KR60 산업용 로봇 암에서 랩조인 작업에 대해 3회 중 3회 성공적으로 배포되었다.
  • 각 버퍼가 한 개의 전이만 포함하는 구성에서는 DER의 성능 향상이 없었으며, 이는 버퍼 구조와 샘플링 전략에 민감함을 시사한다.
  • DER는 기존의 Ape-X DDPG가 주어진 훈련 시간 내에 해결하지 못하는 고정밀 조립 작업의 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.