QUICK REVIEW
[論文レビュー] Building Dynamic Knowledge Graphs from Text-based Games
Mikuláš Zelinka, Xingdi Yuan|arXiv (Cornell University)|Oct 21, 2019
Topic Modeling参考文献 13被引用数 8
ひとこと要約
本稿では、30万件のゲーム遷移から構成される新しいデータセットを用いて、自然言語によるゲーム観測から動的知識グラフ(KG)の更新操作を生成する、シーケンス・ツー・シーケンス型のトランスフォーマーモデルを提案する。このモデルは、学習済みの関係埋め込みを用いた関係的グラフ畳み込みネットワーク(R-GCN)を活用することで、誤りが蓄積される自由走行推論環境において、ベースラインを著しく上回る性能を発揮する。
ABSTRACT
We are interested in learning how to update Knowledge Graphs (KG) from text. In this preliminary work, we propose a novel Sequence-to-Sequence (Seq2Seq) architecture to generate elementary KG operations. Furthermore, we introduce a new dataset for KG extraction built upon text-based game transitions (over 300k data points). We conduct experiments and discuss the results.
研究の動機と目的
- インタラクティブな環境において、自然言語テキストから動的知識グラフを動的に更新する汎用的手法を開発すること。
- 部分観測可能で、テキストベースのゲームにおける正確で進化する世界の知識を維持する課題に対処すること。
- 現実的でウォークスラフでないゲーム遷移を想定した、動的KG更新モデルの学習と評価を可能にするデータセットを構築すること。
- テキスト観測から正確なKG更新操作を生成することで、強化学習エージェントの世界モデル化を改善すること。
提案手法
- モデルは二重エンコーダー構造を採用:過去の行動と新しい観測を処理するトランスフォーマー基盤のテキストエンコーダーと、事前信念グラフを表現するグラフエンコーダー。
- 学習済みの関係埋め込みを用いた関係的グラフ畳み込みネットワーク(R-GCN)がKGを符号化し、関係の構造的および意味的情報を捉える。
- アテンションベースのアグレゲーターがテキスト表現とグラフ表現を統合し、デコーダーのための文脈に適した隠れ状態を生成する。
- トレーニングでは教師強制法を用い、デコーダーがトークン単位でKG更新操作のシーケンスを生成する。推論時には自己回帰的デコードを実行する。
- モデルは負の対数尤度損失で学習され、出力はRDF三項組形式と互換性を持つ。
- 提案手法は、ゲーム状態遷移から抽出された正例KGを有する、30万件のテキストベースゲーム遷移で構成される新規データセット上で評価された。
実験結果
リサーチクエスチョン
- RQ1ニューラルなシーケンス・ツー・シーケンスモデルは、テキストベースのゲームにおける自然言語観測から正確なKG更新操作を効果的に生成できるか?
- RQ2グラフエンコーダーに関係的情報を組み込むと、動的KG更新の正確性にどのような影響を与えるか?
- RQ3非ウォークスラフな行動(オフポリシー遷移)から学習することで、実世界の強化学習環境におけるKG更新モデルのロバストネスが向上するか?
- RQ4誤りの蓄積効果は、自由走行推論シナリオにおけるKG更新モデルの性能にどのように影響を与えるか?
- RQ5関係ラベルの意味を符号化する関係埋め込みは、標準的なR-GCNよりも一般化性能を向上させるか?
主な発見
- R-GCNと関係埋め込みを組み合わせたモデルが、自由走行推論で最高のF1スコア0.697を達成し、関係的情報を含まないモデルを著しく上回った。
- 関係埋め込みを有するR-GCNバージョンは、標準R-GCNと比較して自由走行F1スコアを5.2ポイント向上させ、関係の意味的モデリングの重要性を示した。
- 教師強制法下のF1スコアが0.965から自由走行推論下のF1スコアが0.697に低下したことは、反復的KG更新における誤り蓄積の課題を示している。
- 関係埋め込みの使用により、標準R-GCNと比較して自由走行F1スコアが5.2%絶対値で向上した。これは、関係の意味的性質をモデル化することの利点を強調している。
- 標準トランスフォーマー・エンコーダーを用い、グラフエンコーダーを搭載しないモデルは、教師強制法下でもF1スコア0.832にとどまり、グラフ構造が高性能を達成するために不可欠であることを示している。
- オフポリシー行動を含む30万件の遷移から構成されるデータセットは、強化学習環境における一般化のための強固な学習を可能にしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。