Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Multi-Robot Collaboration with Large Language Models: Centralized or Decentralized Systems?

Yongchao Chen, Jacob Arkin|arXiv (Cornell University)|Sep 27, 2023
Natural Language Processing Techniques被引用数 7
ひとこと要約

本論文は、スケーラブルなマルチロボットタスクプランニングを目的とした、4つのLLMベースのフレームワーク—集中型、分散型、および2つのハイブリッド型—を提案し、評価している。その結果、特にローカルフィードバックを中央プランナーに与えるHMAS-2というハイブリッドフレームワークが、2次元および3次元のマルチロボット環境において、タスク成功確率が高く、スケーラビリティに優れていることが判明した。これは、純粋な集中型または分散型アプローチを上回っている。

ABSTRACT

A flurry of recent work has demonstrated that pre-trained large language models (LLMs) can be effective task planners for a variety of single-robot tasks. The planning performance of LLMs is significantly improved via prompting techniques, such as in-context learning or re-prompting with state feedback, placing new importance on the token budget for the context window. An under-explored but natural next direction is to investigate LLMs as multi-robot task planners. However, long-horizon, heterogeneous multi-robot planning introduces new challenges of coordination while also pushing up against the limits of context window length. It is therefore critical to find token-efficient LLM planning frameworks that are also able to reason about the complexities of multi-robot coordination. In this work, we compare the task success rate and token efficiency of four multi-agent communication frameworks (centralized, decentralized, and two hybrid) as applied to four coordination-dependent multi-agent 2D task scenarios for increasing numbers of agents. We find that a hybrid framework achieves better task success rates across all four tasks and scales better to more agents. We further demonstrate the hybrid frameworks in 3D simulations where the vision-to-text problem and dynamical errors are considered. See our project website https://yongchao98.github.io/MIT-REALM-Multi-Robot/ for prompts, videos, and code.

研究の動機と目的

  • ロボット数やタスクの予測期間が増加する際の、LLMベースのマルチロボットプランニングにおけるスケーラビリティ制限を解決すること。
  • 集中型、分散型、ハイブリッド型といった異なる通信および計画アーキテクチャが、タスク成功確率とトークン効率に与える影響を調査すること。
  • 文脈長および歴史的対話の影響が、マルチエージェント協調におけるLLMの推論性能に与える影響を評価すること。
  • 2次元シミュレーテッドウェアハウスタスクおよび3次元の操作タスク(視覚からテキストへの変換と動的エラーを伴う)において、ハイブリッドフレームワークの有効性を実証すること。
  • エージェント数の増加に伴っても性能を維持できる、トークン効率的で一般化可能なプランニングフレームワークを提供すること。

提案手法

  • 4つのフレームワークを提案:DMAS(分散型マルチエージェントシステム)、CMAS(集中型マルチエージェントシステム)、HMAS-1(中央計画のプリミングを伴う分散型)、HMAS-2(ロボット固有のLLMからのローカルフィードバックを伴う集中型)。
  • 各計画ステップで、LLMエージェント間の反復的・ターンベースの対話を通じて、全ロボットの次の行動を共同で決定する。
  • 文脈長を短縮し、トークン効率を向上させるために、以前のラウンドからの状態-行動履歴のみを保持する「トリuncatedプロンプト戦略」を導入する。
  • 手動で定義された関数を用いて、環境の観測値とロボットの能力をLLM入力用の自然言語プロンプトに変換する。
  • 事前に定義されたアクションマッピングを通じて、LLMが出力するテキストを実行可能なロボット行動に変換する。
  • 2次元のウェアハウスを模したタスクと、3次元のPyBulletシミュレーション(視覚からテキストへの認識(ViLD)と動的実行エラーを伴う)において、フレームワークを評価する。
Figure 1: Simplified prompt example of the HMAS-1 local agent. The acquired ’Response1’ acts as the initial plan, or otherwise sent to the next local agent for further discussion.
Figure 1: Simplified prompt example of the HMAS-1 local agent. The acquired ’Response1’ acts as the initial plan, or otherwise sent to the next local agent for further discussion.

実験結果

リサーチクエスチョン

  • RQ1集中型、分散型、ハイブリッド型のLLMベースのプランニングフレームワークは、ロボット数の増加に伴って、タスク成功確率とスケーラビリティの観点でどのように比較されるか?
  • RQ2文脈長と歴史的対話の影響は、マルチロボット協調におけるLLM推論性能にどのように影響するか?
  • RQ3中央計画とローカルLLMフィードバックを組み合わせたハイブリッドフレームワークは、純粋な集中型または分散型システムと比較して、成功確率とスケーラビリティの両面で向上するか?
  • RQ43次元環境における視覚からテキストへの認識と動的エラーは、LLMベースのプランニングフレームワークのロバストネスにどのように影響するか?
  • RQ5トリuncatedプロンプト戦略は、計画性能を劣化させることなく、どの程度トークン効率を向上させるか?

主な発見

  • ロボット固有のLLMからのローカルフィードバックを中央LLMが受けるHMAS-2フレームワークは、3台および6台のロボットを用いた3次元シミュレーションにおいて、100%のタスク成功を達成した。
  • 6台のロボットを用いた3次元シミュレーションにおいて、CMASは平均1.39の正規化された行動ステップを要したが、HMAS-2はわずか1.03にとどまり、より優れた計画効率を示した。
  • 6台ロボットのケースにおいて、HMAS-2は2.65の正規化されたAPIコールと1.31の正規化トークンを用いたが、これはCMAS(1.0と1.18)と比較して、より高い複雑性にもかかわらず、より優れたトークン効率を示した。
  • ハイブリッド型のHMAS-1フレームワークは、すべての4つの2次元タスクにおいて、純粋な分散型のDMASと比較して成功確率が向上し、エージェント数の増加に伴ってより良好にスケーリングした。
  • すべてのフレームワークが、3次元シミュレーションにおける動的エラーに対してロバストであった。反復的計画により、行動が失敗した場合でも効果的な再計画が可能であった。
  • トリuncatedプロンプト戦略は、性能を劣化させることなく文脈長を効果的に短縮でき、トークン予算制約下でのスケーラビリティを支援した。
Figure 2: Simplified prompt example of the HMAS-2 central agent. The generated ’Response1’ is sent to local agents for feedback. Once the central-local iteration terminates, the output plan is checked for syntactic correctness.
Figure 2: Simplified prompt example of the HMAS-2 central agent. The generated ’Response1’ is sent to local agents for feedback. Once the central-local iteration terminates, the output plan is checked for syntactic correctness.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。