Skip to main content
QUICK REVIEW

[논문 리뷰] APPLD: Adaptive Planner Parameter Learning from Demonstration

Xuesu Xiao, Bo Liu|arXiv (Cornell University)|2020. 03. 31.
Robotic Path Planning Algorithms참고 문헌 25인용 수 5
한 줄 요약

APPLD는 단일 인간 원격 조작 시범을 통해 로봇 주행 시스템의 적응형 파rameter 조정 방법을 제안한다. 시범을 맥락으로 분할하고, 행동 복제를 통해 맥락별 플래너 파arameter를 학습함으로써, APPLD는 배포 중에 주행 파arameter를 동적으로 조정할 수 있게 하여, 복잡한 환경에서 두 대의 다른 로봇과 주행 시스템에서 기본 설정 및 전문가가 튜닝한 설정을 모두 능가하는 성능을 달성한다.

ABSTRACT

Existing autonomous robot navigation systems allow robots to move from one point to another in a collision-free manner. However, when facing new environments, these systems generally require re-tuning by expert roboticists with a good understanding of the inner workings of the navigation system. In contrast, even users who are unversed in the details of robot navigation algorithms can generate desirable navigation behavior in new environments via teleoperation. In this paper, we introduce APPLD, Adaptive Planner Parameter Learning from Demonstration, that allows existing navigation systems to be successfully applied to new complex environments, given only a human teleoperated demonstration of desirable navigation. APPLD is verified on two robots running different navigation systems in different environments. Experimental results show that APPLD can outperform navigation systems with the default and expert-tuned parameters, and even the human demonstrator themselves.

연구 동기 및 목표

  • 비전문가 사용자가 단일 원격 조작 시범만으로도 새로운 환경에 적합한 로봇 주행 시스템을 적응시킬 수 있도록 한다.
  • 기본 설정 또는 전문가가 튜닝한 설정이 다양한 맥락에서 일반화되지 못하는 복잡한 환경에서의 파arameter 튜닝 문제를 해결한다.
  • 기본 플래너 아키텍처나 수작업으로 설계된 특징에 의존하지 않는 블랙박스이자 일반화 가능한 방법을 개발한다.
  • 맥락 인식 기반 파arameter 적응을 통해 기본 파arameter 설정과 전문가가 튜닝한 설정을 모두 능가하는 우수한 주행 성능을 달성한다.

제안 방법

  • 센서 데이터와 행동을 기반으로 한 변경점 탐지 알고리즘(CHAMP)을 사용하여 인간 원격 조작 주행 시범을 서로 다른 맥락으로 분할한다.
  • 검출된 각 맥락에 대해 행동 복제 모델을 훈련시어 시범자 행동을 재현하는 최적의 플래너 파aram터를 학습한다.
  • 배포 시점에 실시간으로 센서 입력을 사용하여 현재 환경 맥락을 식별하는 맥락 예측 모델을 사용한다.
  • 예측된 맥락에 따라 추론 시점에 주행 시스템의 파aram터를 동적으로 전환함으로써 적응형 행동을 가능하게 한다.
  • 기본 주행 시스템을 블랙박스로 간주하여 내부 플래너 아키텍처나 수작업으로 설계된 특징에 의존하지 않는다.
  • 행동 복제 손실 최소화를 통해 파aram터를 최적화하며, 실제 로봇 배포를 통한 평가를 수행한다.

실험 결과

연구 질문

  • RQ1단일 인간 원격 조작 시범이 복잡하고 다양한 환경에서 로봇 주행의 효과적인 파aram터 튜닝을 가능하게 하는가?
  • RQ2맥락 인식 기반 파aram터 적응이 고정 파aram터 설정(기본 설정 또는 전문가가 튜닝한 설정)보다 주행 성능에서 뛰어나게 되는가?
  • RQ3제안된 방법이 아키텍처 수정 없이도 다양한 로봇과 주행 시스템 간에 일반화 가능한가?
  • RQ4사전 환경 지식 없이도 센서 데이터와 행동 데이터로부터 의미 있는 맥락 경계를 학습할 수 있는가?
  • RQ5학습된 파aram터 적응이 실제 배포 환경에서 인간 시범자보다도 뛰어난 성능을 내는가?

주요 결과

  • APPLD는 Jackal과 BWIBot 양쪽에서 기본 파aram터 설정을 능가하여, Jackal에서는 행동 복제 손실을 34.7% 감소시키고, BWIBot에서는 29.8% 감소시켰다.
  • BWIBot에서 APPLD의 파aram터는 행동 복제 손실 0.0669 ± 0.0071을 기록하여 전문가가 튜닝한 손실 0.0940 ± 0.0095보다 유의미하게 낮았다.
  • 실제 환경 배포에서 APPLD가 생성한 경로는 기본 설정 및 전문가가 튜닝한 설정보다 인간 시범자의 경로에 정성적으로 더 가까웠다.
  • CHAMP가 변경점 탐지에 실패하여 단일 맥락(균일한 복도 환경)으로 간주된 BWIBot의 경우, 적절한 맥락 인식이 이루어졌음을 확인했다.
  • APPLD는 핵심 학습 프레임워크를 수정하지 않고도 dwa와 e-band와 같은 다양한 주행 시스템 간에 일반화 성능을 보였다.
  • 시범자의 목표가 속도가 아닌(예: 사무실 복도에서 매끄럽고 직선적인 주행) 경우에도 성능이 뛰어나, 다양한 주행 목표에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.