Skip to main content
QUICK REVIEW

[논문 리뷰] Can LLMs plan paths in the real world?

Wanyi Chen, Meng-Wen Su|arXiv (Cornell University)|2024. 11. 26.
Private Equity and Venture CapitalBusiness, Management and Accounting인용 수 3
한 줄 요약

이 연구는 GPT-4, Gemini, 그리고 Mistral과 같은 세 개의 대규모 언어 모델이 도시, 근교, 농촌 환경을 포함한 여섯 가지 다양한 실제 환경에서 실제 경로 계획 능력을 평가한다. 다양한 프롬프팅 전략에도 불구하고 모든 모델이 다수의 오류를 유발하여 실질적인 탐색 작업에서 심각한 비신뢰성을 드러냈다.

ABSTRACT

As large language models (LLMs) increasingly integrate into vehicle navigation systems, understanding their path-planning capability is crucial. We tested three LLMs through six real-world path-planning scenarios in various settings and with various difficulties. Our experiments showed that all LLMs made numerous errors in all scenarios, revealing that they are unreliable path planners. We suggest that future work focus on implementing mechanisms for reality checks, enhancing model transparency, and developing smaller models.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 실제 환경에서 정확한 경로 계획 지침을 신뢰성 있게 생성할 수 있는지 평가하는 것.
  • 도시, 근교, 농촌 지역과 같은 다양한 실제 환경에서 LLMs의 성능을 평가하여 복잡성 수준의 다양성을 고려하는 것.
  • LLMs를 사용하여 단계별 안내(Turn-by-Turn Navigation, TbT)와 시각적 랜드마크 기반 안내(Visual Landmark-based Navigation, VLN) 간의 성능을 비교하는 것.
  • 실제 환경에서 LLM이 생성한 지침에 나타나는 체계적인 오류를 특정하고 그 원인을 이해하는 것.
  • 경로 계획 작업을 위한 더 나은 모델 투명성, 현실 검증 메커니즘, 그리고 더 작고 신뢰도가 높은 모델 개발의 필요성을 주장하는 것.

제안 방법

  • George Mason University를 출발점으로 삼아 도시, 근교, 농촌 환경의 세 가지 유형에서 총 여섯 개의 실제 경로 계획 실험을 수행하였다.
  • GPT-4, Gemini, 그리고 Mistral 7B의 세 개의 LLM을 사용하여 단계별 안내(TbT)와 시각적 랜드마크 기반 안내(VLN) 프롬프팅 전략을 모두 테스트하였다.
  • 실제 차량 또는 보행자 이동을 시뮬레이션하기 위해 단계별 주행 지시나 랜드마크 기반 안내 신호를 생성하도록 프롬프트를 설계하였다.
  • 사실의 정확성, 경로 논리성, 랜드마크 일관성, 시간 계획 등에 대해 모델의 응답을 수집하고 분석하였다.
  • 실시간 데이터 제약 조건을 인지하고 외부 사실을 확인할 수 있는 능력을 테스트하기 위해 후속 질의를 수행하였다.
  • 시간 제약 조건 하에서 또는 모순되거나 잘못된 정보에 직면했을 때 모델의 행동을 평가하였다.
(a) GPT’s path
(a) GPT’s path

실험 결과

연구 질문

  • RQ1LLMs는 실제 도시, 근교, 농촌 환경에서 정확하고 안전하며 실행 가능한 단계별 안내 지침을 생성할 수 있는가?
  • RQ2복잡하거나 표지판이 적은 환경에서 LLMs는 기존 GPS 스타일 라우팅과 비교해 시각적 랜드마크 기반 안내(VLN)에서 얼마나 잘 수행되는가?
  • RQ3LLMs는 교통 상황, 시간 창, 영업 시간과 같은 실제 제약 조건을 얼마나 잘 인식하고 적절히 반응하는가?
  • RQ4실제 환경에서 LLM이 생성한 경로 계획에서 가장 흔히 발생하는 오류 유형—공간적, 사실적, 논리적 오류—는 무엇인가?
  • RQ5모델 크기와 아키텍처(예: GPT-4 대비 Mistral 7B)가 실제 경로 계획에서의 신뢰성과 일관성에 어떤 영향을 미치는가?

주요 결과

  • 테스트된 모든 세 개의 LLM—GPT-4, Gemini, 그리고 Mistral—모두 실제 환경에서 수많은 심각한 오류를 유발했으며, 잘못된 경로 순서와 잘못된 가정이 포함되어 있었다.
  • GPT-4는 Shot Tower State Park가 네바다주에 있다고 잘못 주장했고, 후속 질의를 통해 버지니아주로 수정하는 것으로 나타나 사실 기반 지식이 부족함을 보였다.
  • Mistral 7B는 버지니아에 위치한 공원에 대해 버지니아에서 네바다주까지 2,500마일의 경로를 생성하여 심각한 공간 추론 실패를 보였다.
  • LLMs는 종종 실시간 운영 데이터(예: 공원 영업 시간)를 확인하지 못했으며, 휴일 일정을 확인하기 위해 실시간 정보에 액세스할 수 없었다.
  • 후속 질의가 있음에도 불구하고 모델들은 오류를 수정하거나 자신의 데이터 접근 제약 조건을 인지하지 못하는 경우가 많았다.
  • 이 연구는 LLMs가 환상, 낮은 사실 기반 지식, 현실 검증 기능 부족으로 인해 현재로서는 실제 경로 계획에 신뢰할 수 없다고 결론 내렸다.
(b) Gemini’s path
(b) Gemini’s path

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.