Skip to main content
QUICK REVIEW

[논문 리뷰] LeTS-Drive: Driving in a Crowd by Learning from Tree Search

Panpan Cai, Yuanfu Luo|arXiv (Cornell University)|2019. 05. 29.
Data Stream Mining Techniques인용 수 8
한 줄 요약

LeTS-Drive는 민감한 환경에서 안전하고 효율적이며 부드러운 자율 주행을 가능하게 하기 위해 믿음 트리 탐색에서의 모방 학습과 온라인 POMDP 계획을 융합한 하이브리드 프레임워크를 제안한다. 전문가 트리 탐색으로부터 정책과 가치 함수를 학습하고 이를 실시간 탐색을 안내하는 데 사용함으로써, LeTS-Drive는 순수 계획 또는 순수 학습에 비해 충돌을 50% 감소시키고 주행 시간을 30% 단축시켰다.

ABSTRACT

Autonomous driving in a crowded environment, e.g., a busy traffic intersection, is an unsolved challenge for robotics. The robot vehicle must contend with a dynamic and partially observable environment, noisy sensors, and many agents. A principled approach is to formalize it as a Partially Observable Markov Decision Process (POMDP) and solve it through online belief-tree search. To handle a large crowd and achieve real-time performance in this very challenging setting, we propose LeTS-Drive, which integrates online POMDP planning and deep learning. It consists of two phases. In the offline phase, we learn a policy and the corresponding value function by imitating the belief tree search. In the online phase, the learned policy and value function guide the belief tree search. LeTS-Drive leverages the robustness of planning and the runtime efficiency of learning to enhance the performance of both. Experimental results in simulation show that LeTS-Drive outperforms either planning or imitation learning alone and develops sophisticated driving skills.

연구 동기 및 목표

  • 많은 상호작용하는 보행자가 존재하는 동적인 부분 관찰 가능한 환경에서 자율 주행의 과제를 해결한다.
  • 순수한 모방 학습(예: 일반화 능력 부족)과 순수한 계획(예: 높은 계산 비용)의 한계를 극복한다.
  • 계획의 강건성과 학습의 효율성을 활용하여 장기적이고 안전하며 부드러운 주행을 가능하게 하는 방법을 개발한다.
  • 다양한 혼잡한 상황과 지도 레이아웃에서 학습된 신경망을 통해 새로운 환경으로의 일반화를 가능하게 한다.

제안 방법

  • 모방 학습을 위한 시범 데이터를 생성하기 위해 온라인 믿음 트리 탐색을 전문가로 사용한다.
  • 전문가의 행동 선택을 모방하는 딥 정책 네트워크와 믿음 하위트리의 가치를 추정하는 가치 네트워크를 훈련시킨다.
  • 학습된 정책과 가치 함수를 히우리스틱으로 통합하여 실시간 의사결정에서 온라인 믿음 트리 탐색을 안내한다.
  • 초기 계획을 제공하기 위해 게이트드 패스 플래닝 네트워크(GPPN)를 사용하고, 이를 보조 신경망 구성요소로 보완한다.
  • 고차원적이고 부분 관찰 가능한 믿음 공간에서 효과적으로 작동하는 신경망 설계를 위해 도메인 특화 지식을 적용한다.
  • 오프라인 모방 학습과 학습된 모델을 사용한 온라인 가이드 탐색을 조합한 하이브리드 이단계적 접근을 적용한다.

실험 결과

연구 질문

  • RQ1전문가 트리 탐색에서 유도된 학습된 정책과 가치 함수는 복잡한 혼잡한 보행자 주행 환경에서 실시간 성능을 향상시키는가?
  • RQ2학습과 계획을 융합함으로써 자율 주행의 안전성, 효율성, 부드러움은 어떻게 향상되는가?
  • RQ3학습된 모델은 새로운 레이아웃과 예측 불가능한 보행자 행동을 포함한 새로운 환경으로 얼마나 잘 일반화되는가?
  • RQ4가이드 탐색 메커니즘은 순수 계획 또는 순수 학습에 비해 성능을 유지하거나 향상시키면서 계산 비용을 줄일 수 있는가?

주요 결과

  • LeTS-Drive는 Decoupled-Action-POMDP 및 LeTS-Drive-Imitation에 비해 주행 시간을 약 30% 단축시키고 감속 횟수를 50% 이상 감소시켰다.
  • 레이아웃이 크게 다른 새로운 테스트 지도에서 99%의 성공률을 기록하며, 순수 모방 학습에 비해 뛰어난 성능을 보였다.
  • LeTS-Drive는 랜덤화된 보행자 위치와 의도에 대해 잘 일반화되어 있으며, 다양한 시나리오에서 높은 성능를 유지했다.
  • 사례 연구 결과 차량이 보행자 집단을 피하거나 좁은 통로를 보행자와의 상호작용을 통해 통과하는 등 고도화된 행동을 개발하는 것으로 나타났다.
  • 학습과 계획의 통합은 국소 최적값을 피하고 더 매끄럽고 효율적인 경로를 생성하는 데 기여했다.
  • 가치 네트워크는 유망하지 않은 믿음 하위트리 탐색을 줄여 탐색 효율성을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.