Skip to main content
QUICK REVIEW

[論文レビュー] VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View

Raphael Schumann, Wanrong Zhu|arXiv (Cornell University)|Jul 12, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

VELMA は、ストリートビューにおける視覚言語ナビゲーションのための新しい LLM ベースのエージェントであり、行動予測の文脈として言語化された視覚的観察と軌跡履歴を用いる。指示からランドマークを抽出し、CLIP を用いてその可視性を検証することで、2 つのデータセットで微調整した後、タスク完了率が相対的に 25% 向上し、最先端の性能を達成した。

ABSTRACT

Incremental decision making in real-world environments is one of the most challenging tasks in embodied artificial intelligence. One particularly demanding scenario is Vision and Language Navigation~(VLN) which requires visual and natural language understanding as well as spatial and temporal reasoning capabilities. The embodied agent needs to ground its understanding of navigation instructions in observations of a real-world environment like Street View. Despite the impressive results of LLMs in other research areas, it is an ongoing problem of how to best connect them with an interactive visual environment. In this work, we propose VELMA, an embodied LLM agent that uses a verbalization of the trajectory and of visual environment observations as contextual prompt for the next action. Visual information is verbalized by a pipeline that extracts landmarks from the human written navigation instructions and uses CLIP to determine their visibility in the current panorama view. We show that VELMA is able to successfully follow navigation instructions in Street View with only two in-context examples. We further finetune the LLM agent on a few thousand examples and achieve 25%-30% relative improvement in task completion over the previous state-of-the-art for two datasets.

研究の動機と目的

  • 大規模で現実世界の都市環境(例:ストリートビュー)において、大規模言語モデル(LLMs)が段階的意思決定を実行できるようにすること。
  • 動的で現実世界の視覚的観察に自然言語ナビゲーション指示を適切に対応付ける課題に対処すること。
  • 言語化された環境状態と軌跡的文脈を活用することで、視覚言語ナビゲーション(VLN)における少サンプルおよび微調整性能を向上させること。
  • タッチダウン環境の限界(交差点での誤った行動アライメント、TURN_AROUND のような直感的な行動の欠如)を解消すること。
  • エンドツーエンド学習を伴わず、言語化に基づくエージェント化によっても、複雑な現実世界の VLN タスクで強力な性能を達成できることを示すこと。

提案手法

  • VELMA は、タスク説明、ナビゲーション指示、過去の行動、および言語化された視覚的観察を含む自然言語シーケンスを LLM に提示する言語化ベースのプロンプティング戦略を採用する。
  • 視覚的観察は、人間が書いた指示からランドマークを抽出し、CLIP を用いてランドマークと現在のパノラマビュー間の類似度スコアを計算することで言語化される。
  • エージェントは、全文脈プロンプトに基づいて、各ステップで次の行動(例:FORWARD、TURN_LEFT、TURN_AROUND)を予測することで段階的意思決定を実行する。
  • 政策学習と一般化を向上させるために、教師強制と生徒強制を組み合わせた新しいトレーニング手順である応答ベース学習(RBL)を導入し、混合比 λ=0.5 を用いる。
  • エージェントがゴールに到達できない場合、最適な反事後的行動シーケンスをオラクルが計算し、是正の監視を提供する。
  • 環境の改変を含む:交差点の誤アライメントの修正と、ナビゲーションの現実性と性能向上のための TURN_AROUND 動作の追加。

実験結果

リサーチクエスチョン

  • RQ1言語化された文脈(エンドツーエンド学習を伴わず)を用いることで、LLMs を現実世界の大規模都市環境(例:ストリートビュー)に効果的に実装できるか?
  • RQ2ランドマーク検出と CLIP を用いた可視性スコアリングによる視覚的観察の言語化は、LLM ベースのナビゲーション性能向上にどの程度有効か?
  • RQ3わずか 2 つの少サンプル例でのイン・コンテキスト学習で都市部 VLN で競争力のある性能を達成できるか?また、微調整はどのように性能を向上させるか?
  • RQ4環境レベルの改変(例:TURN_AROUND の追加、交差点の問題の修正)は、エージェントの性能とトレーニングの安定性にどのような影響を与えるか?
  • RQ5ビジョンエンコーダーの選択(CLIP 対 OpenCLIP)は、ランドマーク検出および全体的なタスク成功にどのように影響するか?

主な発見

  • VELMA は、Map2seq データセットで少サンプルイン・コンテキスト学習において 23% のタスク完了率を達成し、タッチダウンでは 10% を記録した。2 つの少サンプル例でのみの学習でも、強力な少サンプル一般化性能を示した。
  • 全トレーニングセットで微調整した後、VELMA はタッチダウンで 26% のタスク完了率、Map2seq で 47% を達成し、前回の最先端性能比で相対的に 25% 向上した。
  • ランドマークスコアリングに OpenCLIP を使用した場合、元の CLIP モデルを上回る性能を示し、改善されたビジョンエンコーダーがエージェント性能に直接寄与することを示した。
  • プロンプトからランドマーク情報を削除すると、特にタッチダウンで性能が著しく低下した。これは、文脈内での視覚的接地の重要性を確認した。
  • TURN_AROUND 動作の追加と交差点の誤りの是正により、エージェントが複雑な停止条件を処理する能力が顕著に向上した。
  • 「Y の手前で止まる」や「X で止まるが、Y を超えてはいけない」などの曖昧な停止指示に対し、エージェントは不確実なランドマークを通り過ぎ、再び可視になった時点で戻る行動を学習し、効果的な空間的推論を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。