[論文レビュー] Scalable Multi-Robot Collaboration with Large Language Models: Centralized or Decentralized Systems?
本論文は、スケーラブルなマルチロボットタスクプランニングを目的とした、4つのLLMベースのフレームワーク—集中型、分散型、および2つのハイブリッド型—を提案し、評価している。その結果、特にローカルフィードバックを中央プランナーに与えるHMAS-2というハイブリッドフレームワークが、2次元および3次元のマルチロボット環境において、タスク成功確率が高く、スケーラビリティに優れていることが判明した。これは、純粋な集中型または分散型アプローチを上回っている。
A flurry of recent work has demonstrated that pre-trained large language models (LLMs) can be effective task planners for a variety of single-robot tasks. The planning performance of LLMs is significantly improved via prompting techniques, such as in-context learning or re-prompting with state feedback, placing new importance on the token budget for the context window. An under-explored but natural next direction is to investigate LLMs as multi-robot task planners. However, long-horizon, heterogeneous multi-robot planning introduces new challenges of coordination while also pushing up against the limits of context window length. It is therefore critical to find token-efficient LLM planning frameworks that are also able to reason about the complexities of multi-robot coordination. In this work, we compare the task success rate and token efficiency of four multi-agent communication frameworks (centralized, decentralized, and two hybrid) as applied to four coordination-dependent multi-agent 2D task scenarios for increasing numbers of agents. We find that a hybrid framework achieves better task success rates across all four tasks and scales better to more agents. We further demonstrate the hybrid frameworks in 3D simulations where the vision-to-text problem and dynamical errors are considered. See our project website https://yongchao98.github.io/MIT-REALM-Multi-Robot/ for prompts, videos, and code.
研究の動機と目的
- ロボット数やタスクの予測期間が増加する際の、LLMベースのマルチロボットプランニングにおけるスケーラビリティ制限を解決すること。
- 集中型、分散型、ハイブリッド型といった異なる通信および計画アーキテクチャが、タスク成功確率とトークン効率に与える影響を調査すること。
- 文脈長および歴史的対話の影響が、マルチエージェント協調におけるLLMの推論性能に与える影響を評価すること。
- 2次元シミュレーテッドウェアハウスタスクおよび3次元の操作タスク(視覚からテキストへの変換と動的エラーを伴う)において、ハイブリッドフレームワークの有効性を実証すること。
- エージェント数の増加に伴っても性能を維持できる、トークン効率的で一般化可能なプランニングフレームワークを提供すること。
提案手法
- 4つのフレームワークを提案:DMAS(分散型マルチエージェントシステム)、CMAS(集中型マルチエージェントシステム)、HMAS-1(中央計画のプリミングを伴う分散型)、HMAS-2(ロボット固有のLLMからのローカルフィードバックを伴う集中型)。
- 各計画ステップで、LLMエージェント間の反復的・ターンベースの対話を通じて、全ロボットの次の行動を共同で決定する。
- 文脈長を短縮し、トークン効率を向上させるために、以前のラウンドからの状態-行動履歴のみを保持する「トリuncatedプロンプト戦略」を導入する。
- 手動で定義された関数を用いて、環境の観測値とロボットの能力をLLM入力用の自然言語プロンプトに変換する。
- 事前に定義されたアクションマッピングを通じて、LLMが出力するテキストを実行可能なロボット行動に変換する。
- 2次元のウェアハウスを模したタスクと、3次元のPyBulletシミュレーション(視覚からテキストへの認識(ViLD)と動的実行エラーを伴う)において、フレームワークを評価する。

実験結果
リサーチクエスチョン
- RQ1集中型、分散型、ハイブリッド型のLLMベースのプランニングフレームワークは、ロボット数の増加に伴って、タスク成功確率とスケーラビリティの観点でどのように比較されるか?
- RQ2文脈長と歴史的対話の影響は、マルチロボット協調におけるLLM推論性能にどのように影響するか?
- RQ3中央計画とローカルLLMフィードバックを組み合わせたハイブリッドフレームワークは、純粋な集中型または分散型システムと比較して、成功確率とスケーラビリティの両面で向上するか?
- RQ43次元環境における視覚からテキストへの認識と動的エラーは、LLMベースのプランニングフレームワークのロバストネスにどのように影響するか?
- RQ5トリuncatedプロンプト戦略は、計画性能を劣化させることなく、どの程度トークン効率を向上させるか?
主な発見
- ロボット固有のLLMからのローカルフィードバックを中央LLMが受けるHMAS-2フレームワークは、3台および6台のロボットを用いた3次元シミュレーションにおいて、100%のタスク成功を達成した。
- 6台のロボットを用いた3次元シミュレーションにおいて、CMASは平均1.39の正規化された行動ステップを要したが、HMAS-2はわずか1.03にとどまり、より優れた計画効率を示した。
- 6台ロボットのケースにおいて、HMAS-2は2.65の正規化されたAPIコールと1.31の正規化トークンを用いたが、これはCMAS(1.0と1.18)と比較して、より高い複雑性にもかかわらず、より優れたトークン効率を示した。
- ハイブリッド型のHMAS-1フレームワークは、すべての4つの2次元タスクにおいて、純粋な分散型のDMASと比較して成功確率が向上し、エージェント数の増加に伴ってより良好にスケーリングした。
- すべてのフレームワークが、3次元シミュレーションにおける動的エラーに対してロバストであった。反復的計画により、行動が失敗した場合でも効果的な再計画が可能であった。
- トリuncatedプロンプト戦略は、性能を劣化させることなく文脈長を効果的に短縮でき、トークン予算制約下でのスケーラビリティを支援した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。