Skip to main content
QUICK REVIEW

[論文レビュー] Can LLMs plan paths in the real world?

Wanyi Chen, Meng-Wen Su|arXiv (Cornell University)|Nov 26, 2024
Private Equity and Venture CapitalBusiness, Management and Accounting被引用数 3
ひとこと要約

本研究では、GPT-4、Gemini、Mistral の3つの大規模言語モデルが、都市部、準都市部、地方部を含む6つの多様な現実世界のシナリオにおいて、実際の経路計画能力を評価している。提示方法の違いにもかかわらず、すべてのモデルが多数の誤りを生じさせ、実用的なナビゲーションタスクにおける顕著な信頼性の欠如が明らかになった。

ABSTRACT

As large language models (LLMs) increasingly integrate into vehicle navigation systems, understanding their path-planning capability is crucial. We tested three LLMs through six real-world path-planning scenarios in various settings and with various difficulties. Our experiments showed that all LLMs made numerous errors in all scenarios, revealing that they are unreliable path planners. We suggest that future work focus on implementing mechanisms for reality checks, enhancing model transparency, and developing smaller models.

研究の動機と目的

  • 大規模言語モデル(LLM)が現実世界の環境において正確な経路計画の指示を信頼性を持って生成できるかどうかを評価すること。
  • 都市部、準都市部、地方部を含む多様な現実世界の環境において、LLMの性能を評価すること。
  • LLMを用いたターン・バイ・ターン(TbT)ナビゲーションと視覚的ランドマークベースのナビゲーション(VLN)の性能を比較すること。
  • 現実世界の文脈において、LLMが生成する誘導に見られる体系的な誤りを特定し、その根本的原因を理解すること。
  • モデルの透明性の向上、現実確認メカニズムの導入、およびナビゲーションタスクに適したより小型で信頼性の高いモデルの開発を提言すること。

提案手法

  • George Mason University を出発点として、都市部、準都市部、地方部の3つのシナリオにおいて、6つの現実世界の経路計画実験を実施した。
  • GPT-4、Gemini、Mistral 7B の3つのLLMを、ターン・バイ・ターン(TbT)および視覚的ランドマークナビゲーション(VLN)の提示戦略を用いてテストした。
  • ステップバイステップの運転誘導またはランドマークベースのナビゲーションの手がかりを生成するようにプロンプトを設計し、実際の車両または歩行者のナビゲーションを模擬した。
  • 事実の正確性、ルートの論理的整合性、ランドマークの一貫性、時間的計画の観点から、モデルの出力を収集・分析した。
  • リアルタイムデータの制限を認識しているか、外部の事実を検証できるかをテストするために、フォローアップクエリを実施した。
  • 時間制約下でのモデルの振るまい、および矛盾するまたは誤った情報に直面した際の対応を評価した。
(a) GPT’s path
(a) GPT’s path

実験結果

リサーチクエスチョン

  • RQ1LLMは、現実世界の都市部、準都市部、地方部の環境において、正確で安全かつ実行可能なターン・バイ・ターンナビゲーション誘導を生成できるか?
  • RQ2複雑な環境や標識が少ない環境において、LLMは従来のGPS風ルーティングと比較して、視覚的ランドマークベースのナビゲーション(VLN)でどの程度の性能を示すか?
  • RQ3LLMは、交通状況、時間枠、営業時間といった現実世界の制約をどの程度正しく認識し、適切に対応できるか?
  • RQ4現実世界の設定において、LLMが生成するナビゲーション計画で最も一般的に発生する誤りの種類(空間的、事実的、論理的)は何か?
  • RQ5モデルのサイズやアーキテクチャ(例:GPT-4 と Mistral 7B)は、現実世界の経路計画における信頼性と一貫性にどの程度影響を及ぼすか?

主な発見

  • GPT-4、Gemini、Mistral の3つのLLMすべてが、テストされたすべての現実世界のシナリオで複数の深刻な誤りを生じさせ、誤ったルート順序や誤った仮定が含まれていた。
  • GPT-4は、ショットタワー・ステート・パークがネバダ州にあると誤って主張したが、フォローアップ後にバージョンをバージニア州に訂正した。これは、事実の根拠が乏しいことを示している。
  • Mistral 7B は、バージニア州に位置する公園について、バージニア州からネバダ州への2,500マイルのルートを生成し、深刻な空間的推論の失敗を示した。
  • LLMはリアルタイムの営業時間などの運用データを頻繁に確認できず、祝日スケジュールを確認するためのライブ情報にアクセスできなかった。
  • フォローアップクエリがあっても、モデルは誤りを是正したり、自身のデータアクセス制限を認識したりすることができなかった。
  • 本研究の結論として、LLMは現在のところ、幻覚、事実の根拠の欠如、現実確認の不在のため、現実世界の経路計画には信頼できないと結論づけた。
(b) Gemini’s path
(b) Gemini’s path

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。