Skip to main content
QUICK REVIEW

[논문 리뷰] Lifelong Robotic Reinforcement Learning by Retaining Experiences

Annie Xie, Chelsea Finn|arXiv (Cornell University)|2021. 09. 19.
Reinforcement Learning in Robotics참고 문헌 61인용 수 7
한 줄 요약

이 논문은 물리적 로봇을 위한 수명 주기 강화 학습 프레임워크를 제안하며, 이는 이전 경험을 유지하고 선택적으로 재사용하여 데이터 효율성을 향상시킨다. 과거 경험을 재레이블링하여 사전 훈련하고, 역학 유사도 기반으로 선택적 재생을 통해 미세조정함으로써, 각 작업을 처음부터 학습하는 것과 비교해 표본 요구량을 50% 이상 감소시켰으며, 실제 Franka Panda 로봇에서 10개의 조작 작업을 수행할 때 학습 효율성을 2배 향상시켰다.

ABSTRACT

Multi-task learning ideally allows robots to acquire a diverse repertoire of useful skills. However, many multi-task reinforcement learning efforts assume the robot can collect data from all tasks at all times. In reality, the tasks that the robot learns arrive sequentially, depending on the user and the robot's current environment. In this work, we study a practical sequential multi-task RL problem that is motivated by the practical constraints of physical robotic systems, and derive an approach that effectively leverages the data and policies learned for previous tasks to cumulatively grow the robot's skill-set. In a series of simulated robotic manipulation experiments, our approach requires less than half the samples than learning each task from scratch, while avoiding impractical round-robin data collection. On a Franka Emika Panda robot arm, our approach incrementally learns ten challenging tasks, including bottle capping and block insertion.

연구 동기 및 목표

  • 물리적 로봇에서 동시에 여러 작업을 수행할 수 없는 실용적 제약을 해결하기 위해 순환 다중작업 강화 학습의 한계를 해결한다.
  • 이전에 수집된 경험을 활용하여 새로운 작업의 학습을 가속화함으로써 효율적인 수명 주기 학습을 가능하게 한다.
  • 재해로 기억 상실을 방지하면서도 구조적인 경험 재사용을 통해 전진 전이를 촉진한다.
  • 다양한 목표와 물리적 설정을 가진 실제 세계의 로봇 조작 작업에 적합한 확장 가능하고 데이터 효율적인 프레임워크를 개발한다.

제안 방법

  • 새로운 작업마다 두 단계를 수행한다: 재생 버퍼에서의 이전 경험에 대한 사전 훈련, 그리고 역학 유사도 기반 선택적 재생을 통한 온라인 미세조정.
  • 사전 훈련 전에 현재 작업의 보상 함수를 사용해 이전 경험을 재레이블링하여 새로운 목표와 일치시킨다.
  • 이전 작업의 샘플을 현재 작업의 역학과의 유사도 기반으로 필터링하여 표본 선택 편향을 보정한다.
  • 과거 전이와 현재 작업의 역학 간의 유사도 측도를 사용해 전이에 가장 관련성이 높은 경험을 우선순위로 지정한다.
  • 경험 재생과 정책 네트워크 가중치 전이를 조합함으로써 안정성과 표본 효율성을 모두 향상시킨다.
  • 프레임워크는 과거 경험을 완전히 기억한다고 가정하며, 실현 가능하지 않은 순환 다중수집 방식을 피하고 전진 전이에 집중한다.

실험 결과

연구 질문

  • RQ1이전에 해결된 작업의 경험을 효과적으로 재사용하여, 생명 주기 학습 환경에서 새로운 작업의 학습을 가속화할 수 있는가?
  • RQ2다른 역학과 보상 구조를 가진 다양한 작업에서 경험을 전이할 때 표본 선택 편향을 어떻게 완화할 수 있는가?
  • RQ3현재 작업의 역학과 유사도 기반으로 과거 경험을 선택적으로 재생할 경우, 표준 경험 재생에 비해 데이터 효율성과 학습 안정성이 향상되는가?
  • RQ4경험 기반 전이가 물리적 로봇의 생명 주기 강화 학습에서 가중치 기반 전이를 얼마나 잘 보완할 수 있는가?
  • RQ5이 프레임워크는 순환 다중수집을 요구하지 않고도 실제 로봇 조작 작업에서 상당한 표본 효율성 향상을 달성할 수 있는가?

주요 결과

  • 실제 Franka Emika Panda 로봇에서, 이 방법은 1만 개의 환경 단계 내에 목표까지의 평균 거리를 0.75cm로 유지했으며, 각 작업을 처음부터 학습할 경우 1.83cm로 더 높았다.
  • 이 방법은 10개의 도전적인 조작 작업을 학습하는 데 필요한 환경 단계 수를 10만 이내로 줄여, 처음부터 학습하는 것에 비해 2배 빠른 학습 효율성을 달성했다.
  • 역학 유사도 기반으로 이전 경험을 필터링함으로써 학습 효율성이 크게 향상되었으며, 표준 경험 재생은 최적의 정책 도달에 실패했다.
  • 절단 실험을 통해 사전 훈련된 재레이블링 데이터와 선택적 온라인 재생이 성능 향상에 필수적인 요소임을 확인했으며, 각각 표본 효율성에 독립적인 기여를 했다.
  • 재레이블링된 과거 데이터를 활용해 관련 없는 탐색 단계 수를 줄여, 목표에 더 빨리 수렴할 수 있도록 했다.
  • 이 프레임워크는 병렬 조작, 블록 삽입, 밸브 조임 등 다양한 작업에서 일관된 전진 전이를 보였으며, 시뮬레이션과 실제 실험 모두에서 안정적이고 효율적인 학습 곡선을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.