Skip to main content
QUICK REVIEW

[論文レビュー] Dialogue Shaping: Empowering Agents through NPC Interaction

Wei Zhou, Xiangyu Peng|arXiv (Cornell University)|Jul 28, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLM)を用いてテキストベースのゲーム内の非プレイヤーNPCと会話を行い、重要なゲーム知識を抽出し、それを知識グラフに変換することで強化学習(RL)エージェントの学習を加速する『ダイアログシェーピング』というフレームワークを提案する。この手法により、ベースラインエージェントと比較してRLの収束時間を80%以上短縮し、エージェントは約10,000ステップで最適方策に到達するのに対し、ベースラインでは約90,000ステップを要する。

ABSTRACT

One major challenge in reinforcement learning (RL) is the large amount of steps for the RL agent needs to converge in the training process and learn the optimal policy, especially in text-based game environments where the action space is extensive. However, non-player characters (NPCs) sometimes hold some key information about the game, which can potentially help to train RL agents faster. Thus, this paper explores how to interact and converse with NPC agents to get the key information using large language models (LLMs), as well as incorporate this information to speed up RL agent's training using knowledge graphs (KGs) and Story Shaping.

研究の動機と目的

  • テキストベースのゲームにおける強化学習(RL)エージェントの収束が遅い問題(膨大な行動空間と疎な報酬)を解決すること。
  • NPCとの会話的インタラクションが、RLエージェントの効率的かつ的確な誘導に役立つゲーム知識を抽出できるかどうかを検討すること。
  • 知識グラフとストーリーシェーピングを介してLLMから得た知識をRL学習に統合し、方策学習の加速を図ること。
  • 会話ベースの情報抽出が、テキストアドベンチャー環境におけるRLエージェントのパフォーマンスとサンプル効率性を向上させるかどうかを評価すること。

提案手法

  • 微調整済みLLMを会話エージェントとして用い、テキストベースのゲーム内のNPCと対話し、構造化された質問を投げかけてゲーム関連の知識を抽出する。
  • LLMの会話応答から、エージェント中心の行動(主語が「you」であるもの)を抽出して、目的の前提条件を表す、ターゲット知識グラフ(KG)を構築する。
  • ストーリーシェーピングを適用し、エージェントの内部KGとターゲットKGとの重複に基づいて、RLエージェントに補助報酬信号を提供する。
  • 環境の疎な報酬に加え、KGベースの報酬信号を用いてKGA2Cエージェントを学習させ、方策学習をガイドする。
  • LIGHTフレームワークを用いて、明確な勝利条件と構造化されたゲーム状態を持つカスタムのテキストアドベンチャー・ゲームを生成する。
  • 100,000ステップの学習中に定期的に測定した50エピソードの平均テストスコアを用いて、パフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1LLMを用いたNPCとの会話が、RLエージェントの学習を加速するための重要なゲーム知識を信頼性高く抽出できるか?
  • RQ2NPCの会話内容を知識グラフとして表現することで、RLエージェントが最適方策に到達するのをどれほど効果的に支援できるか?
  • RQ3LLMから得た知識グラフを用いたストーリーシェーピングにより、RLの収束に必要な訓練ステップ数はどの程度削減できるか?
  • RQ4会話ベースの知識抽出手法は、標準のRLエージェントと比較して、サンプル効率性とパフォーマンスの一貫性に優れているか?

主な発見

  • Game 1において、LLMから得た知識グラフを用いたストーリーシェーピングエージェントは、約10,000ステップで最適方策に収束したのに対し、ベースラインエージェントは約90,000ステップを要した。
  • すべての訓練ステップにおいて、ストーリーシェーピングエージェントの平均テストスコアはベースラインを一貫して上回り、標準偏差の範囲が重複しないことが確認された。
  • この手法により必要な訓練ステップ数が80%以上削減され、サンプル効率性の顕著な向上が示された。
  • 構造化された質問テンプレートを用いることで、LLM会話エージェントは正確なゲーム情報(オブジェクトの依存関係や目的の前提条件など)を、最小限の誤認知(ホールーシュネーション)で効果的に抽出できた。
  • 会話から生成されたターゲット知識グラフは、RLエージェントを最適方策に導く信頼性が高く効果的な補助報酬信号を提供した。
  • このフレームワークは複数のテキストベースのゲームにおいても堅牢に機能し、評価されたすべての環境で一貫したパフォーマンス向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。