Skip to main content
QUICK REVIEW

[論文レビュー] Learning beyond datasets: Knowledge Graph Augmented Neural Networks for Natural language Processing

K. M. Annervaz, Somnath Basu Roy Chowdhury|arXiv (Cornell University)|Feb 16, 2018
Topic Modeling参考文献 33被引用数 16
ひとこと要約

本論文では、注意メカニズムを用いて動的に関連する世界知識を取得することで、NLPモデルの性能を向上させる知識グラフ拡張ニューラルネットワークを提案する。エンティティおよび関係の表現を畳み込みアーキテクチャで圧縮することで、テキスト分類および自然言語推論タスクにおける性能が顕著に向上し、ラベル付きデータが30%少ない状況でも同様の性能を発揮する。これは、深層学習に構造化された世界知識を統合することの有効性を示している。

ABSTRACT

Machine Learning has been the quintessential solution for many AI problems, but learning is still heavily dependent on the specific training data. Some learning models can be incorporated with a prior knowledge in the Bayesian set up, but these learning models do not have the ability to access any organised world knowledge on demand. In this work, we propose to enhance learning models with world knowledge in the form of Knowledge Graph (KG) fact triples for Natural Language Processing (NLP) tasks. Our aim is to develop a deep learning model that can extract relevant prior support facts from knowledge graphs depending on the task using attention mechanism. We introduce a convolution-based model for learning representations of knowledge graph entity and relation clusters in order to reduce the attention space. We show that the proposed method is highly scalable to the amount of prior information that has to be processed and can be applied to any generic NLP task. Using this method we show significant improvement in performance for text classification with News20, DBPedia datasets and natural language inference with Stanford Natural Language Inference (SNLI) dataset. We also demonstrate that a deep learning model can be trained well with substantially less amount of labeled training data, when it has access to organised world knowledge in the form of knowledge graph.

研究の動機と目的

  • 深層学習モデルがラベル付き学習データにのみ依存するという限界を、外部の構造化された世界知識を統合することで克服すること。
  • 深層学習モデルが推論時に大規模な知識グラフから関連する事実を動的にアクセスおよび統合できるようにすること。
  • 外部の知識ベースを活用することで、ラベル付き学習データの大量必要を低減すること。
  • 特定のデータセットに特化しない、スケーラブルで汎用的なフレームワークを構築すること。
  • 構造化された世界知識を統合することで、標準的なモデルがフルデータセットで学習した場合と比較して優れた性能を発揮することを実証すること。

提案手法

  • エンティティおよび関係クラスタの表現を圧縮するために畳み込みニューラルネットワークを用い、注意の対象領域を縮小する。
  • 圧縮された知識グラフ表現に対して注意メカニズムを適用し、タスクに適した事実をオンデマンドで取得する。
  • 最終予測の前に、取得した知識を入力特徴と統合することで、データと知識の共同学習を可能にする。
  • このフレームワークは汎用的であり、LSTMを用いたテキスト分類やNLIなどのタスク固有の深層学習モデルに容易に統合可能である。
  • ソフト注意を用いることで、確率的勾配降下法によるエンドツーエンド学習が可能となり、微分可能であることを保証する。
  • 知識グラフの事実トリプル (h, r, t) は構造に基づく手法で埋め込みられ、エンティティおよび関係の表現が同時に学習される。

実験結果

リサーチクエスチョン

  • RQ1推論時に大規模な知識グラフから関連する事実を動的に取得することで、深層学習モデルの性能を向上させることができるか?
  • RQ2大幅に少ないラベル付きデータで学習させた場合でも、知識拡張モデルが標準モデルを上回る性能を発揮できるか?
  • RQ3大規模な知識グラフに対して効率的に注意メカニズムを適用し、関連する事実のみを取得する方法は何か?
  • RQ4タスク固有の再トレーニングなしに、あらゆるNLPモデルに世界知識を統合できるスケーラブルで汎用的なフレームワークを設計可能か?
  • RQ5構造化された世界知識を統合することで、深層学習モデルの一般化性能が向上し、データ依存性が低下するか?

主な発見

  • KG拡張モデルは、20Newsgroupsデータセットの全データで学習したヴァニラLSTMモデルと比較して、70%のデータで学習した場合でも高い正確性を達成した。
  • SNLIデータセットでは、KG拡張モデルが全データベースラインLSTMを上回る正確性を示し、知識の統合効果を実証した。
  • 少ないデータで学習した場合、KG拡張モデルの訓練損失は顕著に低く抑えられ、収束が速く、最適化が良好であることが示された。
  • 畳み込み符号化によるエンティティおよび関係クラスタのコンパクト表現を学習することで、モデルは顕著に注意の対象領域を縮小した。
  • 数百万の事実トリプルを含む大規模な知識ベースに対しても、スケーラビリティが高く、高い性能を維持した。
  • 結果から、知識グラフ拡張により、深層学習における大規模なラベル付きデータセットの必要性を低減できる可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。