Skip to main content
QUICK REVIEW

[論文レビュー] Neural Graph Embedding Methods for Natural Language Processing

Shikhar Vashishth|arXiv (Cornell University)|Nov 8, 2019
Topic Modeling参考文献 177被引用数 11
ひとこと要約

本稿では、知識グラフのスパarsityを軽減し、NLPタスクを向上させるために、新しいニューラルグラフ埋め込み手法を提案する。CESIは、エンティティおよび関係のフレーズ埋め込みとサイド情報を利用して知識グラフの正規化を実現する。RESIDEは、KGのサイド情報を活用した遠隔教師付き関係抽出を実現する。NeuralDaterは、構文的および時間的GCNを用いて文書の日付を特定する。SynGCNは、依存木構造に基づく単語埋め込みを実現する。ConfGCNは、信頼度に配慮した近傍アグリゲーションを実現する。CompGCNは、パラメータ効率の良い多関係的グラフ学習を実現する。複数のベンチマークで最先端の結果を達成した。

ABSTRACT

Knowledge graphs are structured representations of facts in a graph, where nodes represent entities and edges represent relationships between them. Recent research has resulted in the development of several large KGs. However, all of them tend to be sparse with very few facts per entity. In the first part of the thesis, we propose two solutions to alleviate this problem: (1) KG Canonicalization, i.e., identifying and merging duplicate entities in a KG, (2) Relation Extraction which involves automating the process of extracting semantic relationships between entities from unstructured text. Traditional Neural Networks like CNNs and RNNs are constrained to handle Euclidean data. However, graphs in Natural Language Processing (NLP) are prominent. Recently, Graph Convolutional Networks (GCNs) have been proposed to address this shortcoming and have been successfully applied for several problems. In the second part of the thesis, we utilize GCNs for Document Timestamping problem and for learning word embeddings using dependency context of a word instead of sequential context. In this third part of the thesis, we address two limitations of existing GCN models, i.e., (1) The standard neighborhood aggregation scheme puts no constraints on the number of nodes that can influence the representation of a target node. This leads to a noisy representation of hub-nodes which coves almost the entire graph in a few hops. (2) Most of the existing GCN models are limited to handle undirected graphs. However, a more general and pervasive class of graphs are relational graphs where each edge has a label and direction associated with it. Existing approaches to handle such graphs suffer from over-parameterization and are restricted to learning representation of nodes only.

研究の動機と目的

  • オープン知識グラフ(KG)におけるスパarsityという一般的な問題に取り組む。特に、1.34件の事実/エンティティ(NELLの例)というように、エンティティが関係を多く持たない状況を想定する。
  • 未構造化テキストからの関係抽出を活用することで、重複エンティティの正規化と、知識グラフの密度向上による品質向上を図る。
  • グラフ畳み込みネットワーク(GCNs)を活用し、文書日付特定や語の表現学習といったNLPタスクにおける複雑な構造をモデル化する。
  • 既存のGCNモデルの主な限界を克服する:ハブノードの影響が無制限に及ぶこと、多関係的(有向、ラベル付き)グラフを効果的に扱えないこと。

提案手法

  • CESI(EmbeddingsとSide Informationを用いた正規化)を提案。名詞句と関係フレーズの埋め込みを同時に学習し、サイド情報(例:エンティティタイプ、別名)を統合することで、オープンKGにおける重複エンティティのクラスタリングと正規化を実現する。
  • RESIDEを導入。遠隔教師付きニューラル関係抽出モデルであり、GCNを用いて構文的構造を符号化し、エンティティタイプや関係の別名といったサイド情報を統合することで、関係予測のロバスト性を向上させる。
  • NeuralDaterを開発。GCNベースのモデルであり、文書内の構文的および時間的依存構造を同時に符号化することで、最先端の性能で文書の日付を予測する。
  • SynGCNを提案。グラフ畳み込みに基づく手法であり、線形的文脈ではなく依存木構造を用いて単語埋め込みを学習することで、意味的表現を向上させ、語彙の爆発を回避する。
  • ConfGCNを導入。ノードラベルの信頼度スコアを推定し、それを用いて近傍ノードの寄与度を動的に重み付けすることで、GCNのアグリゲーションを強化し、ハブノードからのノイズを低減する。
  • CompGCNを提案。KG埋め込み手法の合成演算子を用いて、エンティティと関係を同時に埋め込む多関係的GCNフレームワークであり、共有関係埋め込みとベース分解を用いることで過パラメータ化を低減する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルグラフ埋め込みを用いて、エンティティの正規化と関係抽出により、オープンKGにおけるスパarsityをどのように軽減できるか?
  • RQ2GCNは、文書における構文的および時間的グラフ構造を効果的にモデル化でき、文書日付特定の性能向上に寄与できるか?
  • RQ3依存木に基づくグラフ畳み込みネットワークは、線形文脈に基づく単語埋め込みを上回る、より豊かな構文的意味を捉えることができるか?
  • RQ4信頼度推定を組み込むことで、GCNのアグリゲーションをハブノードの影響に対してよりロバストにできるか?
  • RQ5統合的かつパラメータ効率の良いフレームワークを設計し、多関係的グラフにおけるエンティティと関係の同時埋め込みを実現できるか?

主な発見

  • CESIは、埋め込みの共同学習とサイド情報の活用により、ベンチマークデータセットでエンティティ正規化の正確性を顕著に向上させ、ベースライン手法を上回った。
  • RESIDEは、エンティティタイプや関係の別名といったサイド情報を効果的に活用することで、限られた教師信号下でも、遠隔教師付き関係抽出で最先端の性能を達成した。
  • NeuralDaterは、GCNを用いて構文的および時間的グラフ構造を同時にモデル化することで、文書日付特定ベンチマークで新たな最先端性能を樹立した。
  • SynGCNは、線形文脈ではなく依存木構造から学習することで、内在的および外在的NLPタスクで既存の単語埋め込み手法を上回った。
  • ConfGCNは、推定された信頼度スコアを用いて近傍ノードの寄与度を動的に重み付けすることで、ハブノードからのノイズ表現を低減し、ノード分類タスクにおける一般化性能を向上させた。
  • CompGCNは、共有関係埋め込みとベース分解のおかげで、従来の手法よりも少ないパラメータ数で多関係的グラフ学習タスクで優れた性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。