[論文レビュー] Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models
Co-NavGPT は、環境プロンプトに基づいてロボットに探索フロントを割り当てる大規模言語モデル(LLM)をグローバルプランナーとして使用する、新しいマルチロボット視覚的意味的ナビゲーションフレームワークです。マップ特徴を自然言語プロンプトにエンコードすることで、ゼロショットで学習を必要としない協調ナビゲーションを実現し、HM3Dで66.1%の成功率と平均ゴール到達時間1.831を達成し、すべてのベースラインを上回りました。
Visual target navigation is a critical capability for autonomous robots operating in unknown environments, particularly in human-robot interaction scenarios. While classical and learning-based methods have shown promise, most existing approaches lack common-sense reasoning and are typically designed for single-robot settings, leading to reduced efficiency and robustness in complex environments. To address these limitations, we introduce Co-NavGPT, a novel framework that integrates a Vision Language Model (VLM) as a global planner to enable common-sense multi-robot visual target navigation. Co-NavGPT aggregates sub-maps from multiple robots with diverse viewpoints into a unified global map, encoding robot states and frontier regions. The VLM uses this information to assign frontiers across the robots, facilitating coordinated and efficient exploration. Experiments on the Habitat-Matterport 3D (HM3D) demonstrate that Co-NavGPT outperforms existing baselines in terms of success rate and navigation efficiency, without requiring task-specific training. Ablation studies further confirm the importance of semantic priors from the VLM. We also validate the framework in real-world scenarios using quadrupedal robots. Supplementary video and code are available at: https://sites.google.com/view/co-navgpt2.
研究の動機と目的
- 複雑な環境における単一ロボットの視覚的ターゲットナビゲーションの非効率性と低耐性を解消すること。
- エンドツーエンド学習に代わって LLM を用いた推論に置き換えることで、マルチロボット協調ポリシーの計算コストを削減すること。
- プロンプトベースのシーン理解を用いて、LLM をグローバルプランナーとして活用し、未知環境における効率的で協調的な探索を実現すること。
- 微調整なしで実現可能なゼロショットのマルチロボット協調ナビゲーションにおける LLM の実用性とパフォーマンスを評価すること。
提案手法
- フレームワークは、意味的マップとロボットの状態を自然言語プロンプトにエンコードすることで、LLM のシーン理解能力を向上させます。
- LLM はグローバルプランナーとして機能し、文脈的情報、ターゲットオブジェクト、空間的レイアウトに基づいて各ロボットに未探索のフロントを割り当てます。
- フロントの選定は、オブジェクトの意味的特性、構造的レイアウト、ロボットの位置、ターゲットの記述を含むプロンプトによってガイドされます。
- 各ロボットは、LLM による割り当て後、一様なローカル計画アルゴリズムを用いて割り当てられたフロントへ向かって行動を実行します。
- 環境特徴は意味的セグメンテーションを介して抽出され、LLM 入力用のテキストプロンプトに統合されます。
- システムはゼロショットで動作し、微調整や強化学習を一切必要としません。
実験結果
リサーチクエスチョン
- RQ1LLM は、学習プロセスを一切経ずにマルチロボット協調視覚ナビゲーションの効果的グローバルプランナーとして機能できるか?
- RQ2環境特徴のプロンプトベースのエンコードが、LLM の探索とターゲット探索に関する推論能力をどのように向上させるか?
- RQ3従来のヒューリスティック法や学習済みポリシーと比較して、LLM を用いたフロント割り当てによるパフォーマンス向上はどの程度か?
- RQ4意味的セグメンテーションの正確さが、Co-NavGPT フレームワーク全体のナビゲーション成功確率にどのように影響するか?
主な発見
- Co-NavGPT は HM3D ベンチマークで 66.1% の成功率を達成し、すべてのベースライン(Greedy: 61.1%、Cost-Utility: 62.5%、Random Sampling: 63.6%)を顕著に上回りました。
- 平均ゴール到達時間(DTG)は 1.831 にまで低下し、すべての手法の中で最低であり、ナビゲーション効率の優位性を示しています。
- 単一ロボット版である Single-NavGPT は 53.9% の成功率にとどまり、マルチロボット協調によるパフォーマンス向上の有効性が裏付けられました。
- 真値セグメンテーションを用いた Co-NavGPT GT-Seg では成功率が 75.7% に上昇し、正確な意味的マッピングの重要性が浮き彫りになりました。
- アブレーションスタディにより、意味的セグメンテーションが重要なボトルネックであることが確認され、予測されたセグメンテーションに置き換えるとパフォーマンスが著しく低下しました。
- モデルは優れた一般化性能を示し、微調整や強化学習なしに高いパフォーマンスを達成したため、LLM がゼロショットマルチロボット計画に実用的であることが実証されました。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。