Skip to main content
QUICK REVIEW

[論文レビュー] ProAgent: Building Proactive Cooperative Agents with Large Language Models

Ceyao Zhang, Kaijie Yang|arXiv (Cornell University)|Aug 22, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

ProAgent は、チームメイトの意図を推論し、計画を検証し、信念を修正することで、リアルタイムで行動を動的に適応させる、大規模言語モデル(LLM)ベースのフレームワークである。ProAgent は、人間の代理モデルとのゼロショット協調において、最先端の手法を10%以上上回り、Overcooked-AI環境における多様なマルチエージェントシナリオでも優れたパフォーマンスを発揮する。

ABSTRACT

Building agents with adaptive behavior in cooperative tasks stands as a paramount goal in the realm of multi-agent systems. Current approaches to developing cooperative agents rely primarily on learning-based methods, whose policy generalization depends heavily on the diversity of teammates they interact with during the training phase. Such reliance, however, constrains the agents' capacity for strategic adaptation when cooperating with unfamiliar teammates, which becomes a significant challenge in zero-shot coordination scenarios. To address this challenge, we propose ProAgent, a novel framework that harnesses large language models (LLMs) to create proactive agents capable of dynamically adapting their behavior to enhance cooperation with teammates. ProAgent can analyze the present state, and infer the intentions of teammates from observations. It then updates its beliefs in alignment with the teammates' subsequent actual behaviors. Moreover, ProAgent exhibits a high degree of modularity and interpretability, making it easily integrated into various of coordination scenarios. Experimental evaluations conducted within the Overcooked-AI environment unveil the remarkable performance superiority of ProAgent, outperforming five methods based on self-play and population-based training when cooperating with AI agents. Furthermore, in partnered with human proxy models, its performance exhibits an average improvement exceeding 10% compared to the current state-of-the-art method. For more information about our project, please visit~\url{https://pku-proagent.github.io}.

研究の動機と目的

  • 現在の学習ベースの協調エージェントが、多様なトレーニング用チームメイトに依存しているため、ゼロショット協調に苦労するという限界を克服すること。
  • ファインチューニングなしで、LLM ベースのエージェントが能動的にチームメイトの意図を推論し、リアルタイムで行動を適応させること。
  • 明示的な推論、計画、信念の是正メカニズムを通じて、マルチエージェントシステムにおける協調の頑健性と解釈可能性を向上させること。
  • 複雑な協調環境において、多様な AI チームメイトと人間の代理モデルに対するフレームワークの一般化能力を評価すること。

提案手法

  • ProAgent は、プランナー、検証者、コントローラー、メモリモジュールを備えたモジュラーパイプラインを採用し、自然言語ベースの推論と計画を可能にする。
  • プランナーは観測からチームメイトの意図を推論し、文脈に応じた推論と過去の相互作用の記憶を活用して高レベルのスキルを生成する。
  • 信念の是正メカニズムは、予測された行動と実際のチームメイトの行動を比較することで、エージェントの意図モデルを更新する。
  • 検証者は事前条件のチェックにより計画の妥当性を検証し、計画に失敗した場合のフィードバックを提供し、再計画を可能にする。
  • コントローラーは妥当な高レベルスキルを実行可能な低レベル行動に分解し、遮断された経路などの環境変化に動的に適応する。
  • システム全体はクローズドループ意思決定プロセスを採用しており、リアルタイムでの適応と計画失敗からの回復を可能にする。

実験結果

リサーチクエスチョン

  • RQ1LLM ベースのエージェントは、ファインチューニングなしでゼロショット協調において能動的にチームメイトの意図を推論し、行動を適応させることができるか?
  • RQ2検証者モジュールは、動的な環境で計画の失敗を検出し、回復するのにどの程度効果的か?
  • RQ3分析と信念のメカニズムを組み込むことで、協調タスクにおける計画の正確性とパフォーマンスはどの程度向上するか?
  • RQ4ProAgent は、複雑な協調環境において、多様な AI チームメイトと人間の代理モデルに一般化することができるか?

主な発見

  • ProAgent は、Overcooked-AI 環境で人間の代理モデルと協調する際、最先端の手法と比較して平均で10%以上のパフォーマンス向上を達成した。
  • 狭い部屋(Cramped Room)レイアウトでは、分析と信念を併用した場合に204点を記録し、信念なしでは184点、分析・信念なしでは100点にとどまった。
  • 検証者モジュールを削除すると、100ステップ間で計画の成功確率が20%に低下し、フィードバックベースの推論と障害回復におけるその重要性が示された。
  • ProAgent は、遮断された経路を動的に代替ルートに再ルーティングすることで回避し、リアルタイムでの適応的行動計画の実現を示した。
  • 非対称なレイアウトにおいても、開始位置の違いの影響が最小限に抑えられ、プロトタイプとは異なり顕著なパフォーマンス差が生じなかった。
  • 自然言語による推論を通じて高い解釈可能性を示し、透明で人間フレンドリーな意思決定プロセスを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。