[論文レビュー] Hierarchical Decision Making by Generating and Following Natural Language Instructions
本稿では、リアルタイムストラテジー(RTS)ゲームにおける複雑で長時間にわたる行動を調整するために、自然言語を潜在的計画(latent plan)として用いる階層的意思決定フレームワークを提案する。人間が生成するような指示に従うことで、直接的な行動クラーニングよりも優れた性能を示し、言語の構成的構造がマルチエージェントシステムのより効果的かつ一般化可能な制御を可能にすることを示している。
We explore using latent natural language instructions as an expressive and compositional representation of complex actions for hierarchical decision making. Rather than directly selecting micro-actions, our agent first generates a latent plan in natural language, which is then executed by a separate model. We introduce a challenging real-time strategy game environment in which the actions of a large number of units must be coordinated across long time scales. We gather a dataset of 76 thousand pairs of instructions and executions from human play, and train instructor and executor models. Experiments show that models using natural language as a latent variable significantly outperform models that directly imitate human actions. The compositional structure of language proves crucial to its effectiveness for action representation. We also release our code, models and data.
研究の動機と目的
- 複雑で長時間にわたるマルチエージェント環境における階層的意思決定を可能にするために、複雑な行動を自然言語の指示として表現すること。
- 直接的な行動シーケンスよりも、自然言語がポリシー学習のためのより表現力があり、構成的な表現として機能するかどうかを検証すること。
- インstructerが指示を生成し、executorがそれらを実行する二段階のフレームワークを構築・評価し、一般化性能とサンプル効率を向上させること。
- 訓練および評価用に、76,000件のヒューマン生成指示実行ペアを含む大規模データセットを収集・公開すること。
提案手法
- フレームワークは二段階のアーキテクチャを採用:インstructerモデルが自然言語の指示を生成し、別個のexecutorモデルがそれを解釈・実行する。
- インstructerモデルは、複数ステップの目標を記述する高レベルで構成的な指示を生成するように訓練される。
- executorモデルは、指示を実行可能な行動にマッピングするように訓練され、言語の構造を解釈する能力を学ぶ。
- 本手法は、多数のユニットを長時間にわたって協調させる必要があるカスタムのリアルタイムストラテジー(RTS)ゲーム環境で評価される。
- 両方のモデルの訓練を監督するため、76,000件のヒューマンプレイによる指示実行ペアのデータセットが収集された。
- 言語の構成的性質を活用することで、未観測のタスク構造へ一般化し、ゼロショット転移を向上させることができる。
実験結果
リサーチクエスチョン
- RQ1自然言語は、複雑で長時間にわたる環境における階層的意思決定のための効果的で構成的な潜在的表現として機能できるか?
- RQ2自然言語の指示を生成・実行することは、マルチエージェント協調タスクにおいて、ヒューマン行動の直接的模倣よりも優れたパフォーマンスをもたらすか?
- RQ3言語の構成的構造は、ポリシー学習における一般化性能とサンプル効率にどのように寄与するか?
- RQ4別個のexecutorモデルは、訓練時に見られなかった新しい指示に対して、どの程度一般化できるか?
主な発見
- 自然言語を潜在変数として用いるモデルは、マルチエージェント協調タスクにおいて、直接的な行動クラーニングのベースラインを著しく上回る性能を示した。
- 言語の構成的構造のおかげで、未観測のタスク構成やより長い時間スケールの計画に、より良い一般化性能が得られた。
- インstructer-Executorフレームワークにより、サンプル効率が向上し、新しい指示タイプへのゼロショット転移が可能になった。
- 76,000件のヒューマンアノテート済み指示実行ペアからなるデータセットのおかげで、二段階システムの有効な訓練と評価が可能になった。
- executorモデルは、意味的・文法的構造を活用することで、新しい指示に一般化でき、分布シフトに対しても頑健であることが示された。
- エンドツーエンドの行動模倣と比較して、長時間にわたるリアルタイムストラテジー戦闘において優れたパフォーマンスを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。