Skip to main content
QUICK REVIEW

[논문 리뷰] ACNMP: Skill Transfer and Task Extrapolation through Learning from Demonstration and Reinforcement Learning via Representation Sharing

Mete Tuluhan Akbulut, Erhan Öztop|arXiv (Cornell University)|2020. 03. 25.
Reinforcement Learning in Robotics참고 문헌 35인용 수 11
한 줄 요약

이 논문은 애널로그 제어 네트워크 기반 강화학습(LfD+RL) 프레임워크인 ACNMP를 제안한다. 이는 애널로그 제어 네트워크를 통해 암시적 지도학습과 강화학습 간의 잠재 표현을 공유함으로써 샘플 효율적인 정책 개선과 스킬 전이를 가능하게 한다. 전문가의 시연 데이터를 기반으로 한 지도학습과 새로운 작업에 대한 강화학습을 동시에 수행함으로써, ACNMP는 시연된 스킬의 특성을 유지하면서도 분포 외 조건에 적응할 수 있으며, 실제 실험을 통한 검증을 통해 외삽 및 교체형 로봇 간 스킬 전이에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

To equip robots with dexterous skills, an effective approach is to first transfer the desired skill via Learning from Demonstration (LfD), then let the robot improve it by self-exploration via Reinforcement Learning (RL). In this paper, we propose a novel LfD+RL framework, namely Adaptive Conditional Neural Movement Primitives (ACNMP), that allows efficient policy improvement in novel environments and effective skill transfer between different agents. This is achieved through exploiting the latent representation learned by the underlying Conditional Neural Process (CNP) model, and simultaneous training of the model with supervised learning (SL) for acquiring the demonstrated trajectories and via RL for new trajectory discovery. Through simulation experiments, we show that (i) ACNMP enables the system to extrapolate to situations where pure LfD fails; (ii) Simultaneous training of the system through SL and RL preserves the shape of demonstrations while adapting to novel situations due to the shared representations used by both learners; (iii) ACNMP enables order-of-magnitude sample-efficient RL in extrapolation of reaching tasks compared to the existing approaches; (iv) ACNMPs can be used to implement skill transfer between robots having different morphology, with competitive learning speeds and importantly with less number of assumptions compared to the state-of-the-art approaches. Finally, we show the real-world suitability of ACNMPs through real robot experiments that involve obstacle avoidance, pick and place and pouring actions.

연구 동기 및 목표

  • 초기 스킬 습득 이후 새로운 환경에서 정책 적응에 대한 샘플 비효율 문제를 해결하기 위해.
  • 강화학습을 통한 정책 정련 과정에서 전문가 시연의 정성적 특성을 유지하여 내재된 스킬 특성에 간섭을 방지하기 위해.
  • 다른 형태의 로봇 간에 자동으로 스킬 전이를 가능하게 하기 위해 공유된 잠재 표현 공간을 학습하기 위해.
  • LfD 및 RL 구성 요소에 동일한 표현을 사용하여 시연된 작업 매개변수 범위를 초월한 일반화 및 외삽 능력을 향상시키기 위해.

제안 방법

  • 모델은 작업 매개변수를 조건으로 하는 시연 트레이젝터리의 잠재 표현을 학습하기 위해 공유된 인코더-디코더 네트워크를 갖춘 조건부 신경과정(CNP) 아키텍처를 사용한다.
  • 모델은 전문가 시연 데이터를 기반으로 한 지도학습과 새로운 환경에서의 정책 개선을 위한 강화학습을 동시에 수행하여 훈련된다.
  • CNP에서 유도된 잠재 표현은 LfD 및 RL 구성 요소 간에 공유되어 일관된 정책 적응을 가능하게 하며, 시연의 정확성을 유지한다.
  • 시스템은 강화학습 기반 정책 업데이트와 시연 데이터 기반 오차 보정을 번갈아 수행함으로써, 궤도 형태 유지 및 일반화 능력 향상을 보장한다.
  • 공유된 잠재 공간 덕분에 서로 다른 형태의 로봇 간에 0-샷 스킬 전이가 가능해지며, 시연를 공통 정책 표현으로 매핑할 수 있다.
  • 실제 환경 구동에서는 6-DOF 로봇 암에 ACNMP가 생성한 관절 트레이젝터리를 실행하기 위해 궤적 추종 제어기를 사용한다.

실험 결과

연구 질문

  • RQ1ACNMP는 시연된 구성의 범위를 초월하는 새로운 작업 매개변수에 대해 스킬 품질을 유지하면서 외삽할 수 있는가?
  • RQ2LfD와 RL 간의 공유 표현 학습이 새로운 환경에서 샘플 효율성과 정책 일반화에 어떻게 기여하는가?
  • RQ3ACNMP는 강화학습 정련 과정에서 전문가 시연의 정성적 특성을 어느 정도 유지하는가?
  • RQ4ACNMP는 좌표 매핑을 명시적으로 제공하지 않더라도 서로 다른 형태의 로봇 간에 효과적인 스킬 전이를 가능하게 하는가?
  • RQ5ACNMP는 장애물 회피 및倒수 작업을 포함한 실제 로봇 조작 작업에서 어떻게 성능을 발휘하는가?

주요 결과

  • 장애물이 있는 픽앤플레이스 작업에서, ACNMP는 객체 높이 9cm, 장애물 높이 11cm 조건에서 평균 관절 오차를 CNMP의 1.861°에서 0.994°로 감소시켰다.
  • 倒수 작업에서, ACNMP는 18회의 롤아웃 후에 목표 마라벨의 오차를 LfD 전용 기법의 600g에서 27g으로 감소시켜 효과적인 외삽과 강화학습 적응을 입증했다.
  • ACNMP는 기존 방법 대비 도달 작업 외삽에 대해 수개의 샘플 효율성을 확보하여, 18회의 롤아웃만으로도 성공적인 적응을 달성했다.
  • 시스템은 새로운 조건에 적응하면서도 시연에서 유도된 높은 품질의 궤도 형태를 유지했으며, 낮은 관절 오차와 더 부드러운 운동 프로파일을 통해 이를 입증했다.
  • ACNMP는 서로 다른 형태의 로봇 간에 성공적인 스킬 전이를 달성했으며, 최신 기술 수준의 접근 방식보다 더 적은 가정으로 경쟁 수준의 학습 속도를 달성했다.
  • 실제 로봇 실험을 통해 ACNMP가 장애물 회피, 픽앤플레이스, 그리고倒수 작업에서 뛰어난 내구성을 보였으며, 실제 적용 가능성에 대한 검증을 완료했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.