Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Heuristic Search via Imitation

Mohak Bhardwaj, Sanjiban Choudhury|arXiv (Cornell University)|2017. 07. 10.
Robotic Path Planning Algorithms참고 문헌 41인용 수 12
한 줄 요약

이 논문은 로봇 운동 계획에서 탐색 효율을 극대화하기 위해 히ュ리스틱 정책을 훈련하는 임의의 학습 프레임워크인 SaIL을 제안한다. 이는 전체 세계 지식을 지닌 가상의 계획자인 클레르바이언트 오라클(전체 상태 지식을 가진 가상의 계획자)을 모방함으로써 탐색 노력의 최소화를 목표로 한다. 동적 프로그래밍을 활용해 훈련 중 최적의 결정을 생성함으로써, SaIL은 환경의 구조에 적응하는 데이터 기반 히ュ리스틱을 학습하며, 다양한 환경에서 최신 기술 대비 탐색 효율성이 뛰어나게 된다.

ABSTRACT

Robotic motion planning problems are typically solved by constructing a search tree of valid maneuvers from a start to a goal configuration. Limited onboard computation and real-time planning constraints impose a limit on how large this search tree can grow. Heuristics play a crucial role in such situations by guiding the search towards potentially good directions and consequently minimizing search effort. Moreover, it must infer such directions in an efficient manner using only the information uncovered by the search up until that time. However, state of the art methods do not address the problem of computing a heuristic that explicitly minimizes search effort. In this paper, we do so by training a heuristic policy that maps the partial information from the search to decide which node of the search tree to expand. Unfortunately, naively training such policies leads to slow convergence and poor local minima. We present SaIL, an efficient algorithm that trains heuristic policies by imitating "clairvoyant oracles" - oracles that have full information about the world and demonstrate decisions that minimize search effort. We leverage the fact that such oracles can be efficiently computed using dynamic programming and derive performance guarantees for the learnt heuristic. We validate the approach on a spectrum of environments which show that SaIL consistently outperforms state of the art algorithms. Our approach paves the way forward for learning heuristics that demonstrate an anytime nature - finding feasible solutions quickly and incrementally refining it over time.

연구 동기 및 목표

  • 실시간 로봇 운동 계획에서 탐색 노력의 최소화를 명시적으로 다루는 히ュ리스틱 학습 방법의 부족을 해결한다.
  • 일반적으로 정적이고 비적응형이며 추정 오차에 민감한 전통적 히ュ리스틱의 한계를 극복한다.
  • 부분 관측 하에서 최적의 의사결정을 모방함으로써 히ュ리스틱 정책을 학습하는 프레임워크를 개발하며, 동적 프로그래밍을 활용해 오라클 시범 데이터를 생성한다.
  • 훈련 데이터 분포를 변경함으로써 환경에 맞는 행동을 학습함으로써, 예를 들어 버그 트랩을 피하거나 좁은 통로를 추적하는 등의 행동을 학습할 수 있도록 한다.
  • 실시간 계획을 위한 anytime 계획을 가능하게 하기 위해, 빠르게 가능해를 찾고 시간이 지남에 따라 개선하는 히ュ리스틱을 학습한다.

제안 방법

  • 부분 관측 하에서의 순차적 의사결정 문제로 히ュ리스틱 탐색을 공식화하며, 정책은 현재 웨이브프론트 기반으로 확장할 노드를 선택한다.
  • 모든 탐색 웨이브프론트에 대해 최적의 확장 결정을 생성하기 위해 전체 상태 지식을 가진 Dijkstra 알고리즘을 활용한 클레르바이언트 오라클을 사용한다.
  • Ross 등 [36]의 데이터셋 집합 접근법을 따르며, 분포 이탈을 최소화하고 수렴을 향상시키기 위해 임의의 학습을 통해 히ュ리스틱 정책을 훈련한다.
  • 오라클의 결정이 동적 프로그래밍을 통해 효율적으로 계산 가능하다는 점을 활용하여, 추론 시 온라인 계획이 필요 없이도 확장 가능한 훈련이 가능하다.
  • 학습된 히ュ리스틱을 표준 탐색 프레임워크(예: A*)에 통합함으로써, 최소한의 계산 오버헤드로 탐색을 안내할 수 있도록 한다.
  • 분포 일반화를 가능하게 하며, 훈련 데이터 분포를 변경함으로써(예: 버그 트랩 대비 좁은 통로), 정책이 재학습 없이도 맥락에 맞는 행동을 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1비용-도착 추정을 넘어서 탐색 노력의 최소화를 명시적으로 고려하는 히ュ리스틱 정책을 훈련시킬 수 있는가?
  • RQ2직접적인 감독이 희박하고 i.i.d.가 아닌 상황에서 부분 관측 하에서 히ュ리스틱 정책을 효율적으로 훈련할 수 있는가?
  • RQ3전체 세계 지식을 지닌 클레르바이언트 오라클을 모방함으로써, 검색 기반 운동 계획에서 강건하고 일반화 가능한 히ュ리스틱 정책를 얻을 수 있는가?
  • RQ4훈련 데이터 분포를 단지 변경함으로써, 예를 들어 탐욕적 대비 경계심 있는 행동 등 다양한 행동을 갖는 히ュ리스틱을 학습할 수 있는가?
  • RQ5학습된 히ュ리스틱이 가능해를 빨리 찾고 점진적으로 개선함으로써 anytime 계획을 지원할 수 있는가?

주요 결과

  • SaIL은 다양한 운동 계획 환경에서 최신 기술 대비 히ュ리스틱 학습 및 검색 기반 계획 방법을 일관되게 슈퍼어링한다.
  • 학습된 히ュ리스틱 정책은 환경의 구조에 적응한다—예를 들어, 버그 트랩 분포로 훈련된 경우 이를 피하고, 갭이 많은 환경으로 훈련된 경우 좁은 통로를 추적한다.
  • 가짜 오라클(현재 믿음 하에서 최선의 행동을 선택하는 오라클)에 대해 near-optimal이 되는 정책의 행동을 보여줌으로써 성능 보장을 도출한다.
  • 프레임워크는 anytime 계획 행동을 가능하게 한다: 히ュ리스틱은 가능한 해를 빠르게 찾고 시간이 지남에 따라 계속 개선되며, 실시간 계획 요구 조건과 일치한다.
  • 분포 이탈에 대해 강건하다: 훈련 데이터 분포를 변경하면 재학습 없이도 질적으로 다른 맥락에 적합한 행동을 보이며, 정책이 재학습 없이도 적응 가능하다.
  • 클레르바이언트 오라클을 동적 프로그래밍을 통해 활용함으로써, 엔드 투 엔드 강화 학습의 샘플 비효율성 문제를 피할 수 있는 효율적이고 확장 가능한 훈련이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.