Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning with Experience Ranking Convolutional Neural Network for Robot Manipulator

Van‐Dinh Nguyen, Hung Manh La|arXiv (Cornell University)|2018. 09. 16.
Reinforcement Learning in Robotics참고 문헌 21인용 수 4
한 줄 요약

이 논문은 로봇 조작 작업에서 DDPG + HER 강화 학습을 향상시키기 위해 경험 순위를 매기는 컨볼루션 신경망(ER-CNN)을 제안한다. 이는 재생을 위해 고보상, 고품질 경험을 우선순위에 두기 위한 것이다. 시각적 및 작업 관련 특징을 기반으로 에피소드를 평가하기 위해 미리 훈련된 CNN을 사용함으로써 학습 수렴 속도를 가속화하고 최종 성능을 향상시킨다. 이로 인해 도어 푸시 작업에서는 100% 성공률를 달성하였고, 복잡한 작업에서는 학습 에피소드 수를 최대 2/3까지 줄였다.

ABSTRACT

Supervised learning, more specifically Convolutional Neural Networks (CNN), has surpassed human ability in some visual recognition tasks such as detection of traffic signs, faces and handwritten numbers. On the other hand, even state-of-the-art reinforcement learning (RL) methods have difficulties in environments with sparse and binary rewards. They requires manually shaping reward functions, which might be challenging to come up with. These tasks, however, are trivial to human. One of the reasons that human are better learners in these tasks is that we are embedded with much prior knowledge of the world. These knowledge might be either embedded in our genes or learned from imitation - a type of supervised learning. For that reason, the best way to narrow the gap between machine and human learning ability should be to mimic how we learn so well in various tasks by a combination of RL and supervised learning. Our method, which integrates Deep Deterministic Policy Gradients and Hindsight Experience Replay (RL method specifically dealing with sparse rewards) with an experience ranking CNN, provides a significant speedup over the learning curve on simulated robotics tasks. Experience ranking allows high-reward transitions to be replayed more frequently, and therefore help learn more efficiently. Our proposed approach can also speed up learning in any other tasks that provide additional information for experience ranking.

연구 동기 및 목표

  • 희소하고 이元적인 보상 문제를 해결함으로써, 표준 방법이 학습 신호가 부족해 어려움을 겪는 로봇 강화 학습 환경에서의 과제를 해결한다.
  • 모든 경험을 동일하게 취급하는 고정된 재생 전략의 한계를 극복함으로써 허슬리 에너지 리플레이(HER)의 한계를 해결한다.
  • 경험 선택을 위한 학습된, 작업에 특화된 평가 메커니즘을 도입함으로써 샘플 효율성과 학습 속도를 향상시킨다.
  • 사전 훈련된 CNN을 통해 사전 지식을 학습 과정에 통합하면 로봇 작업에서 정책 학습의 가속화와 안정성 향상에 크게 기여할 수 있음을 입증한다.

제안 방법

  • 희소 보상을 다루기 위해 딥 디터민리스틱 정책 그레디언트(DDPG)와 허슬리 에너지 리플레이(HER)를 통합한다.
  • 시각적 및 작업 관련 특징을 기반으로 전체 학습 에피소드를 평가하고 순위를 매기는 별도의 사전 훈련된 컨볼루션 신경망(ER-CNN)을 훈련한다.
  • ER-CNN의 출력 점수를 사용하여 에피소드가 재생 버퍼에 저장될지 여부를 결정하며, 높은 순위의 전이만 유지한다.
  • 낮은 순위의 경험(예: 순위 >4)을 폐기하는 필터링 메커니즘을 구현하여 열악한 품질의 데이터가 학습을 악화시키는 것을 방지한다.
  • 4개의 MuJoCo 로봇 작업(도어 푸시, 페치 슬라이드, 페치 푸시, 페치 픽앤플레이스)에 순위 기반 경험 재생을 적용한다.
  • 이미지 기반 특징(예: 물체까지의 거리, 도어 손잡이 존재 여부, 힌지 각도)을 ER-CNN의 입력으로 사용하여 에피소드 평가를 수행한다.

실험 결과

연구 질문

  • RQ1학습된 외부 CNN 기반 순위 매기기 시스템이 희소 보상을 가진 로봇 조작 작업에서 DDPG + HER의 샘플 효율성을 향상시킬 수 있는가?
  • RQ2시각적 및 작업 특화된 특징에 기반한 경험 순위 매기기 전략이 균일하거나 TD-오차 기반 재생 전략과 비교할 때 학습 속도와 최종 성능에서 어떻게 다른가?
  • RQ3사전 훈련된 시각 모델을 사용하면 복잡한 로봇 제어 작업에서 수렴하기 위해 필요한 에피소드 수를 얼마나 줄일 수 있는가?
  • RQ4ER-CNN를 통해 낮은 품질의 경험을 걸러내는 것이 기존 HER보다 더 안정적이고 높은 최종 성공률을 달성하는가?
  • RQ5제안된 방법이 테스트된 환경을 초월해 다양한 로봇 조작 작업에 일반화 가능한가?

주요 결과

  • ER-CNN 방법은 도어 푸시 작업에서 중앙값 성공률 100%를 달성하였으며, 원래의 DDPG + HER는 수렴 시 높은 정확도를 유지하지 못했다.
  • FetchPush-v1 작업에서는 제안된 방법이 원래의 DDPG + HER보다 학습을 완료하는 데 필요한 에피소드 수의 절반으로 줄였다.
  • 더 복잡한 FetchPick&Place-v1 작업에서는 필요한 학습 에피소드 수를 원래 DDPG + HER 기준의 1/3으로 줄였다.
  • ER-CNN 기반 순위 매기기 시스템은 모든 4개의 시뮬레이션 작업에서 학습의 강건성을 향상시켰으며, 수렴 속도가 빠르고 성능이 더 안정적이었다.
  • 실제 세계에서 훈련된 ER-CNN(정확도 80.2%)를 사용했을 경우에도 원래의 DDPG + HER보다 학습 속도와 최종 성능에서 뛰어난 성능을 보였다.
  • 결과적으로, 높은 품질의 시각적 정보를 지닌 경험을 우선순위로 삼는 것이 희소 보상 환경에서 더 효율적이고 안정적인 정책 학습을 이끌 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.