Skip to main content
QUICK REVIEW

[論文レビュー] Polycraft World AI Lab (PAL): An Extensible Platform for Evaluating Artificial Intelligence Agents

Stephen A. Goss, Robert J. Steininger|arXiv (Cornell University)|Jan 27, 2023
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

Polycraft World AI Lab (PAL) は、多様なタスクにおいてAIエージェントを評価することを目的とした拡張可能でAPIベースのプラットフォームである。Polycraft World という Minecraft モッドを基盤として構築されており、柔軟なタスク作成、エージェントおよびNPCの行動のリアルタイムログ記録、カスタマイズ可能なダイナミクスを有する複雑なオープンワールド環境におけるエージェントのトレーニングと評価を可能にしている。

ABSTRACT

As artificial intelligence research advances, the platforms used to evaluate AI agents need to adapt and grow to continue to challenge them. We present the Polycraft World AI Lab (PAL), a task simulator with an API based on the Minecraft mod Polycraft World. Our platform is built to allow AI agents with different architectures to easily interact with the Minecraft world, train and be evaluated in multiple tasks. PAL enables the creation of tasks in a flexible manner as well as having the capability to manipulate any aspect of the task during an evaluation. All actions taken by AI agents and external actors (non-player-characters, NPCs) in the open-world environment are logged to streamline evaluation. Here we present two custom tasks on the PAL platform, one focused on multi-step planning and one focused on navigation, and evaluations of agents solving them. In summary, we report a versatile and extensible AI evaluation platform with a low barrier to entry for AI researchers to utilize.

研究の動機と目的

  • 研究の進展に伴い、ますます複雑化するAIエージェントを評価するための、柔軟でスケーラブルなプラットフォームの必要性に対応する。
  • 既存のAI評価環境の限界を克服し、拡張性、設定の自由度、タスクダイナミクスの細分化された制御を提供する。
  • マルチステップ計画やナビゲーションなどの多様なタスクにおいて、研究者が簡単にAIエージェントの作成・変更・評価を実施できるようにする。
  • 標準化されたAPIインタフェースを通じて、異なるAIエージェントアーキテクチャ間の相互運用性を支援する。
  • すべてのエージェントおよびNPCの行動をリアルタイムでログ記録することで、再現可能で追跡可能なパフォーマンス分析を簡素化する。

提案手法

  • 豊富なインタラクティブ要素を備えた恒久的でオープンワールドのシミュレーション環境を提供する、Polycraft World モッドを基盤として活用する。
  • AIエージェントが離散的アクション(例:移動、合成、相互作用)を使用して環境と対話できるモジュラーAPIを設計する。
  • 実行時におけるタスクパラメータ、目的、環境条件の設定を可能にすることで、動的タスク生成を実装する。
  • 行動シーケンスの詳細な評価と分析を可能にするために、すべてのエージェントおよびNPCの行動を構造化された形式でログ記録する。
  • 評価中に複雑なマルチエージェント相互作用をシミュレートするために、NPCの統合を支援する。
  • 2つのカスタムタスク(マルチステップ計画を重視するものとナビゲーションに焦点を当てたもの)をプロトタイプ化し、AIエージェントの評価に使用する。

実験結果

リサーチクエスチョン

  • RQ1どのような設計により、最小限の設定オーバーヘッドで多様でカスタマイズ可能なタスクをサポートできるAI評価プラットフォームを構築できるか?
  • RQ2動的タスクパラメータを備えたオープンワールド環境は、汎用AIエージェントのトレーニングと評価をどの程度効果的にサポートできるか?
  • RQ3プラットフォームは、複数の相互作用およびタスクタイプにわたる複雑なエージェント行動を効果的にログ記録および分析できるか?
  • RQ4プラットフォームの拡張性は、新しい評価ベンチマークの迅速なプロトタイピングをどの程度可能にするか?
  • RQ5制御可能で設定可能なタスク条件下で評価された場合、異なるAIエージェントのパフォーマンス特性はいかなるものか?

主な発見

  • PAL は、環境および目的パラメータに対する細かな制御を可能にし、複雑でカスタマイズ可能なタスクの作成と実行を可能にしている。
  • プラットフォームはすべてのエージェントおよびNPCの行動を正確にログ記録しており、パフォーマンス評価に不可欠な詳細で追跡可能な記録を提供している。
  • マルチステップ計画とナビゲーションの2つのカスタムタスクが実装され、AIエージェントの評価に使用され、プラットフォームの多様性が実証された。
  • APIベースのアーキテクチャにより、さまざまなAIエージェントアーキテクチャのシームレスな統合が可能となり、研究者が参画しやすくなった。
  • 評価中にタスク条件をリアルタイムで操作でき、動的適応性と耐障害性のテストが可能になった。
  • PAL は、今後のオープンワールド環境におけるAI評価ベンチマーク開発のスケーラブルで拡張可能な基盤を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。