Skip to main content
QUICK REVIEW

[論文レビュー] Text-based RL Agents with Commonsense Knowledge: New Challenges, Environments and Baselines

Keerthiram Murugesan, Mattia Atzeni|arXiv (Cornell University)|Oct 8, 2020
Topic Modeling被引用数 7
ひとこと要約

本論文では、ConceptNetなどの外部ソースから得た常識的知識を統合したテキストベース強化学習エージェントを紹介しており、知識埋め込み(NumberbatchおよびComplex)を用いてText World環境における意思決定を向上させている。主な貢献は、知識を統合したエージェントがベースラインエージェントと比較して顕著に高い報酬とサンプル効率を達成することを示したことであり、特にテスト時の平均報酬で最大8.26の優位性を示した。

ABSTRACT

Text-based games have emerged as an important test-bed for Reinforcement Learning (RL) research, requiring RL agents to combine grounded language understanding with sequential decision making. In this paper, we examine the problem of infusing RL agents with commonsense knowledge. Such knowledge would allow agents to efficiently act in the world by pruning out implausible actions, and to perform look-ahead planning to determine how current actions might affect future world states. We design a new text-based gaming environment called TextWorld Commonsense (TWC) for training and evaluating RL agents with a specific kind of commonsense knowledge about objects, their attributes, and affordances. We also introduce several baseline RL agents which track the sequential context and dynamically retrieve the relevant commonsense knowledge from ConceptNet. We show that agents which incorporate commonsense knowledge in TWC perform better, while acting more efficiently. We conduct user-studies to estimate human performance on TWC and show that there is ample room for future improvement.

研究の動機と目的

  • 複雑でオープンエンドな環境におけるテキストベース強化学習エージェントの限界を克服するため、外部の常識的知識を統合すること。
  • オープンな知識ソース(例:ConceptNet)からの知識埋め込みが、部分的に観測可能な逐次的意思決定タスクにおけるエージェント性能に与える影響を調査すること。
  • 制御された実験環境下で、単純型、履歴拡張型、知識拡張型の複数のエージェントバージョンを設計・評価すること。
  • テキストベース環境における知識強化型強化学習を評価するための新規ベースラインと環境を確立すること。

提案手法

  • 環境は部分的観測マルコフ意思決定過程(POMDP)としてモデル化され、テキストベースのインタラクティブ環境に適したText Worldフレームワークが使用された。
  • 3種類のエージェントバージョンを実装した:単純エージェント(単語埋め込みを使用)、履歴の行動・報酬文脈を統合した変更版エージェント、知識グラフ埋め込みを統合した知識豊富なエージェント。
  • 知識埋め込みは、NumberbatchおよびComplex埋め込みモデルを用いてConceptNetから抽出され、履歴および状態表現と融合された。
  • エージェントの行動選択は、GRUおよびアテンションメカニズムを備えたニューラルネットワークに基づき、状態、履歴、知識埋め込みを統合的に処理する。
  • 統計的妥当性を確保するため、200回の実行を経てトレーニングと評価が実施され、報酬とステップ数が主な指標として測定された。
  • 知識拡張エージェントは、履歴的文脈と外部知識埋め込みをハイブリッド的に組み合わせた表現を用いることで、行動空間の複雑さを低減した。

実験結果

リサーチクエスチョン

  • RQ1オープンな知識ソース(例:ConceptNet)から得た外部の常識的知識は、複雑な環境におけるテキストベース強化学習エージェントの性能を向上させることができるか?
  • RQ2知識埋め込みの統合は、ベースラインエージェントと比較して、サンプル効率および最終的な性能にどのような影響を与えるか?
  • RQ3異なる知識埋め込みタイプ(例:Numberbatch対Complex)の相対的な影響は、エージェントの学習ダイナミクスにどのように現れるか?
  • RQ4履歴的文脈の使用だけが性能向上をもたらすのか、それとも顕著な向上を得るには外部知識が不可欠なのか?
  • RQ5知識拡張エージェントは、未観測の環境やタスクにどの程度一般化可能か?

主な発見

  • Complex埋め込みを用いた知識豊富なエージェントは、テスト時の平均報酬が8.26 ± 0.15に達し、単純エージェント(7.72 ± 0.19)を顕著に上回った。
  • 知識豊富なエージェント2(Complex埋め込み)は、テスト時の平均ステップ数を39.75 ± 0.86にまで低減し、探索の削減とより効率的な計画立案を示した。
  • 知識豊富なエージェントは、ステップ数が低いにもかかわらず、平均報酬8.11 ± 0.18を達成し、変更版エージェント(8.04 ± 0.17)を上回った。これは、より優れた方策品質を示している。
  • 知識統合により、トレーニングおよびテスト段階を通じて、変更版エージェントに対して一貫して0.3~0.5ポイントの報酬向上が見られた。
  • 外部知識の使用により、報酬およびステップ数の指標における分散が低減され、標準誤差が狭くなった。
  • 結果から、ConceptNetのようなオープンソースからの知識埋め込みが、テキストベース環境における強化学習エージェントの推論力と意思決定能力を効果的に向上させられると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。