Skip to main content
QUICK REVIEW

[論文レビュー] Playing Text-Based Games with Common Sense

Sahith N. Dambekodi, Spencer Frazier|arXiv (Cornell University)|Dec 4, 2020
Topic Modeling参考文献 16被引用数 17
ひとこと要約

本稿では、部分観測可能で現実世界に類似した環境において、テキストベースのゲームエージェントの耐性を高めるために、日常的知識を統合する手法を提案する。COMET や BERT を用いて欠落している世界状態要因を推論し、それらを知識グラフに統合することで、特に観測が不完全またはノイズ混じりの状況下でも、挑戦的である9:05「日常のひとこま」ゲームで顕著な性能向上を達成する。

ABSTRACT

Text based games are simulations in which an agent interacts with the world purely through natural language. They typically consist of a number of puzzles interspersed with interactions with common everyday objects and locations. Deep reinforcement learning agents can learn to solve these puzzles. However, the everyday interactions with the environment, while trivial for human players, present as additional puzzles to agents. We explore two techniques for incorporating commonsense knowledge into agents. Inferring possibly hidden aspects of the world state with either a commonsense inference model COMET, or a language model BERT. Biasing an agents exploration according to common patterns recognized by a language model. We test our technique in the 9to05 game, which is an extreme version of a text based game that requires numerous interactions with common, everyday objects in common, everyday scenarios. We conclude that agents that augment their beliefs about the world state with commonsense inferences are more robust to observational errors and omissions of common elements from text descriptions.

研究の動機と目的

  • テキストベースのゲームにおける部分観測の課題に対処すること。ここでは、エージェントが不完全またはノイズ混じりの記述により重要なオブジェクトを逃すことがある。
  • 日常的で現実世界に類似したシナリオにおいて、日常的知識がエージェントのパフォーマンスを向上させるかどうかを調査すること。これは「日常のひとこま」ゲームに共通するシナリオである。
  • 言語モデルのパターンによる探索バイアスと比較して、推論されたエンティティ(COMET や BERT を用いて)を用いてエージェントの世界状態信念を拡張することが、より効果的かどうかを評価すること。
  • 特に9:05ゲームにおいて、観測障害が生じた場合のエージェントの耐性をテストすること。このゲームは日常的な現実世界のルーティンを模倣している。

提案手法

  • COMET と呼ばれるニューラルモデルを用い、自然言語から妥当な世界状態関係(例:HasA)を生成することで、知識グラフに日常的推論を統合する。これにより、KG-A2C エージェントフレームワークを拡張する。
  • BERT の次文予測機能を活用し、自然言語に共通する行動シーケンスを特定することで、行動探索を偏らせる。これにより、エージェントは妥当なコマンドシーケンスに傾倒する。
  • Q*BERT と呼ばれる、BERT を用いた質問応答アプローチを用い、単純な HasA 関係を超えた多様な日常的属性と関係を推論することで、世界状態要因の暗黙的要素のカバレッジを向上させる。
  • 9:05ゲームにおいて、完全な観測と、オブジェクト参照が欠落した変更済みの観測の2条件でエージェントを訓練および評価する。これは現実世界での省略を模倣する。
  • 3つのバリアントを比較する:ベースラインの KG-A2C、KG-A2C-BERT(探索バイアス)、COMET-A2C/Q*BERT(知識グラフ拡張)。
  • 複雑なマルチステップタスクにおける進行度と収束速度を測定するため、スパarsely denseな報酬設計(風呂に入ると2点、シャワーを浴びると6点)を用いる。

実験結果

リサーチクエスチョン

  • RQ1日常的で現実世界に類似したシナリオを有するテキストベースのゲームにおいて、日常的知識がエージェントのパフォーマンスを向上させるか。特に観測が不完全な場合に有効か。
  • RQ2言語モデルのパターンによる探索バイアスと比較して、推論されたエンティティでエージェントの世界状態信念を拡張することは、より効果的か。
  • RQ3COMET と BERT と Q*BERT のような、異なるソースの日常的知識は、観測障害に対する耐性向上においてどのように比較されるか。
  • RQ4単純な HasA 関係を超えた多様な日常的推論を用いることで、複雑な現実世界に類似した環境下で、収束速度が向上し、タスク完了が改善されるか。

主な発見

  • オブジェクト参照が部屋の記述から欠落している状況下では、COMET-A2C および Q*BERT が KG-A2C や KG-A2C-BERT を顕著に上回り、風呂への到達というタスクを完全に完了する。
  • キーオブジェクト(洗面台、トイレ、シャワー)が省略された場合、KG-A2C は報酬2点(風呂に入ること)に留まり、観測ギャップへの脆弱性を示している。
  • オブジェクト欠落状況下でも、KG-A2C-BERT はベースラインの KG-A2C と同等のパフォーマンスに留まり、単に探索バイアスを導入するだけでは、欠落した世界状態知識を補完できないことを示している。
  • オブジェクト欠落状況下では、Q*BERT が COMET-A2C よりも収束が速く、質問応答による多様な日常的推論が、より効果的な世界状態モデリングをもたらしている。
  • 知識グラフに日常的推論を統合することで、観測ノイズに類似した現実世界の状況下でも、探索バイアスよりもより耐性があり信頼性の高いパフォーマンスが得られる。
  • 結果から、日常的知識が、詳細がしばしば明示的ではなく、暗黙的または省略されている現実世界に類似した環境でエージェントが対応できるようにする上で不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。