Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Plan via Neural Exploration-Exploitation Trees.

Binghong Chen, Bo Dai|arXiv (Cornell University)|2019. 02. 28.
Robotic Path Planning Algorithms참고 문헌 40인용 수 8
한 줄 요약

이 논문은 높은 차원의 연속 상태 및 행동 공간에서 효율적인 탐색-이용 균형을 이루기 위해 과거 경험을 학습된 신경망 사전지식을 통해 활용하는 메타경로 계획 알고리즘인 신경 탐색-이용 트리(NEXT)를 소개한다. 이 사전지식을 UCB 기반 트리 탐색과 통합함으로써 NEXT는 샘플 복잡도를 감소시키고, 더 작은 탐색 트리로 보다 뛰어난 성능을 내며 벤치마크 과제에서 최신 기술을 초월한다.

ABSTRACT

Sampling-based algorithms such as RRT and its variants are powerful tools for path planning problems in high-dimensional continuous state and action spaces. While these algorithms perform systematic exploration of the state space, they do not fully exploit past planning experiences from similar environments. In this paper, we design a meta path planning algorithm, called \emph{Neural Exploration-Exploitation Trees} (NEXT), which can exploit past experience to drastically reduce the sample requirement for solving new path planning problems. More specifically, NEXT contains a novel neural architecture which can learn from experiences the dependency between task structures and promising path search directions. Then this learned prior is integrated with a UCB-type algorithm to achieve an online balance between \emph{exploration} and \emph{exploitation} when solving a new problem. Empirically, we show that NEXT can complete the planning tasks with very small searching trees and significantly outperforms previous state-of-the-arts on several benchmark problems.

연구 동기 및 목표

  • 고차원 연속 상태 및 행동 공간에서 RRT와 같은 샘플 기반 계획자에서 발생하는 높은 샘플 복잡도 문제를 해결하기 위해.
  • 유사한 환경 간에 과거 계획 경험을 재사용하여 학습 속도를 향상시키기 위해.
  • 학습된 사전지식을 사용하여 탐색과 이용을 균형 잡는 메타계획 알고리즘 개발을 위해.
  • 새로운 경로 계획 문제를 해결하기 위해 필요한 탐색 트리의 크기를 줄이기 위해.

제안 방법

  • 과거 경험에서 작업 구조와 유망한 경로 탐색 방향 간의 종속성을 학습하는 새로운 신경망 아키텍처를 설계하기 위해.
  • 학습된 신경망 사전지식을 UCB 유형의 트리 탐색 알고리즘에 통합하여 실시간으로 탐색과 이용을 균형 잡기 위해.
  • 작업 특성에 기반하여 탐색 트리의 유망한 확장 방향을 예측하기 위해 미분 가능한 신경망 정책을 사용하기 위해.
  • 이전 계획 과제에서의 시연 또는 재생된 경험을 사용하여 신경망 사전지식을 엔드 투 엔드로 훈련하기 위해.
  • 신경망 사전지식을 UCB 공식의 탐색 보너스로 적용하여 트리 확장을 더 유망한 영역으로 유도하기 위해.
  • 노드가 상태를 나타내고 간선이 동작을 나타내는 계층적 트리 구조를 구성하며, 신경망 사전지식이 노드 선택 및 확장을 안내하기 위해 사용된다.

실험 결과

연구 질문

  • RQ1신경망이 과거 계획 경험을 효과적으로 일반화하여 새로운 경로 계획 과제에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2학습된 사전지식을 실시간으로 탐색과 이용을 균형 잡는 트리 탐색 알고리즘에 통합하는 방법은 무엇인가?
  • RQ3신경망 사전지식이 새로운 계획 과제를 해결하기 위해 필요한 탐색 트리의 크기를 어느 정도 줄이는가?
  • RQ4NEXT는 RRT 및 RRT*와 같은 최신 기술의 샘플 기반 계획자들과 비교해 성능과 샘플 효율성에서 어떻게 성과를 내는가?

주요 결과

  • NEXT는 유사 환경에서의 학습된 경험을 활용하여 새로운 경로 계획 과제를 해결하기 위해 필요한 샘플 수를 크게 줄였다.
  • NEXT가 생성한 탐색 트리는 기준선 방법보다 상당히 작았으며, 이는 더 높은 샘플 효율성을 의미한다.
  • NEXT는 고차원 공간에서 여러 벤치마크 경로 계획 과제에서 이전 최신 기술 알고리즘들을 능가했다.
  • 신경망 사전지식과 UCB 기반 탐색의 통합은 수렴 속도 향상과 계획 성공률 향상에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.