Skip to main content
QUICK REVIEW

[논문 리뷰] ALT-Pilot: Autonomous navigation with Language augmented Topometric maps

Mohammad Omama, Pranav Inani|arXiv (Cornell University)|2023. 10. 03.
Autonomous Vehicle Technology and Safety인용 수 4
한 줄 요약

ALT-Pilot는 고정밀 LiDAR 지도 없이 언어로 증강된 상위 토포메트릭 지도—즉, 지형적 특징을 언어로 기술한 오픈스트리트맵(OpenStreetMap, OSM) 도로 네트워크—를 사용하여 도로 네트워크에서 자율 주행을 가능하게 한다. 이는 시각-언어 모델을 활용해 다중 모odal 국지를 수행하며, 최신 시스템인 MapLite 대비 3배 높은 국지화 정확도와 5배 높은 목표 도달 가능성을 달성한다.

ABSTRACT

We present an autonomous navigation system that operates without assuming HD LiDAR maps of the environment. Our system, ALT-Pilot, relies only on publicly available road network information and a sparse (and noisy) set of crowdsourced language landmarks. With the help of onboard sensors and a language-augmented topometric map, ALT-Pilot autonomously pilots the vehicle to any destination on the road network. We achieve this by leveraging vision-language models pre-trained on web-scale data to identify potential landmarks in a scene, incorporating vision-language features into the recursive Bayesian state estimation stack to generate global (route) plans, and a reactive trajectory planner and controller operating in the vehicle frame. We implement and evaluate ALT-Pilot in simulation and on a real, full-scale autonomous vehicle and report improvements over state-of-the-art topometric navigation systems by a factor of 3x on localization accuracy and 5x on goal reachability

연구 동기 및 목표

  • 자율 주행 시스템에서 고정밀 LiDATOR 지도의 확장성과 비용 제약 문제를 해결한다.
  • 정량적으로 정밀한 지도에 의존하지 않고도 도로 네트워크 상의 임의의 목적지로 정확한 국지화와 주행을 가능하게 한다.
  • 오로지 상위 도로 네트워크 상의 언어로 애너테이션된 지형적 특징만을 사용해 실용적이고 저자원 소모 지도 표현 방식을 제안한다.
  • LiDAR, RGB 및 언어 모달리티를 융합해 실시간 차량 자세 추정을 위한 강력한 다중 모달 국지화 시스템을 개발한다.
  • 자연어 목표, 예를 들어 '앉을 만한 곳을 찾아줘'와 같은 열린 어휘 주행을 가능하게 하기 위해 언어-지형 특징 매칭을 통해 목표 지향 주행을 실현한다.

제안 방법

  • 지속적인 지형 특징(예: 신호등, 표지판 등)의 지리적 태그가 부여된 텍스트 기반 기술을 도로 네트워크에 통합하여 언어로 증강된 상위 토포메트릭 지도를 구축한다.
  • 각 언어 기반 지형 특징에 대해 CLIP 임베딩을 사전 계산하여 시각과 언어 모달리티 간의 교차 어텐션을 가능하게 한다.
  • 추론 단계에서 차량의 내장 RGB 카메라에서 각 픽셀의 CLIP 이미지 임베딩을 추출하고, 이를 순환 베이지안 추정 프레임워크에 활용해 차량 국지화를 수행한다.
  • LiDAR 기반 도로 세그먼테이션 및 코스트맵을 시각-언어 특징과 융합하여 자세 추정의 정확도를 향상시킨다.
  • 국지화 결과를 글로벌 플래닝 및 반응형 궤적 제어 스택에 통합하여 종단 간 주행을 실현한다.
  • 대규모 언어 모델(GPT-4)을 사용해 개방형 자연어 목표를 구조화된 지형 특징 쿼리로 변환하여 목표 지향 주행을 수행한다.
Figure 2 : Pipeline : ALT-Pilot uses OSM maps augmented with language descriptions of landmarks. We precompute the CLIP (language) descriptors for each of these landmarks. At inference time, the LiDAR and Camera information is used to generate per-pixel CLIP (image) descriptors used in our multimoda
Figure 2 : Pipeline : ALT-Pilot uses OSM maps augmented with language descriptions of landmarks. We precompute the CLIP (language) descriptors for each of these landmarks. At inference time, the LiDAR and Camera information is used to generate per-pixel CLIP (image) descriptors used in our multimoda

실험 결과

연구 질문

  • RQ1오로지 상위 도로 네트워크와 희박한 언어 기반 지형 특징만을 사용해 고정밀 LiDAR 지도 없이 자율 주행을 달성할 수 있는가?
  • RQ2시각-언어 모델은 실제 주행 환경에서 국지화 정확도 향상에 있어 시각적 및 언어적 모달리티를 얼마나 효과적으로 융합할 수 있는가?
  • RQ3지형 특징 위치 오류, 가짜 양성 결과, 잘못된 언어 기술 등에 대해 시스템의 견고성은 어느 정도 유지되는가?
  • RQ4언어로 증강된 지도가 의미적으로 기술된 목표(예: '앉을 만한 곳')로 열린 어휘 주행을 가능하게 할 수 있는가?
  • RQ5LiDAR, RGB 및 언어 모달리티의 다중 모달 융합은 지도 전용 또는 시각 전용 기반 대비 국지화 정밀도와 목표 도달 가능성을 얼마나 향상시키는가?

주요 결과

  • ALT-Pilot는 CARLA1 지도에서 평균 절대 자세 오차(APE)가 3.72m로 MapLite의 10.3m 대비 3배 높은 국지화 정확도를 달성한다.
  • 폐루프 주행 테스트에서 ALT-Pilot는 목표까지의 평균 거리를 MapLite 대비 5배 감소시켰으며, 교차로가 아닌 목적지의 경우 1.57m를 기록한 반면 MapLite는 14.37m였다.
  • 시스템은 최대 50%의 가짜 음성 또는 가짜 양성 지형 특징 오류에 대해서도 견고하게 유지되며, APE가 5.89m 이하를 유지하지만, 오류 비율이 80%를 초과하면 성능이 급격히 저하된다.
  • ALT-Pilot는 실제 데이터 기반으로 정상적인 자세로 수렴하는 데 평균 23.32m를 소요하는 데 반해, MapLite는 73.1m를 소요한다.
  • 언어 기반 주행은 GPT-4를 통한 LLM 파싱을 통해 '앉을 만한 곳'과 같은 열린 어휘 목표로 관련 지형 특징을 매칭함으로써 성공적인 경로 계획을 가능하게 한다.
  • 격자형 도심 환경에서, 더 긴 경로 동안 지형 특징의 다양성이 증가함에 따라 언어 기반 지형 특징의 추가가 국지화 성능 향상에 크게 기여한다.
Figure 3 : Topological and Topometric localization on two CARLA maps. ALT-Pilot outperforms MapLite in both topological and topometric localization. Further, it’s more robust to noise in the map while MapLite is adversely affected by it. The impact of noise is more noticeable in the larger CARLA1 ma
Figure 3 : Topological and Topometric localization on two CARLA maps. ALT-Pilot outperforms MapLite in both topological and topometric localization. Further, it’s more robust to noise in the map while MapLite is adversely affected by it. The impact of noise is more noticeable in the larger CARLA1 ma

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.