Skip to main content
QUICK REVIEW

[論文レビュー] Learning Embedding Representations for Knowledge Inference on Imperfect and Incomplete Repositories

Miao Fan, Qiang Zhou|arXiv (Cornell University)|Mar 27, 2015
Topic Modeling参考文献 17被引用数 3
ひとこと要約

本稿では、Freebase や NELL のような不完全で不完全な知識ベースにおいて、エンティティおよび関係の低次元ベクトル表現を学習する確率的知識埋め込みモデル IIKE を提案する。NELL(機械学習)および Freebase(クラウドソーシング)からの信頼度損失を最小化することで、リンク予測およびトリプル分類を改善し、FB15K および NELL でそれぞれ 91.1% および 91.4% の正確度を達成し、最先端の性能を実現した。

ABSTRACT

This paper considers the problem of knowledge inference on large-scale imperfect repositories with incomplete coverage by means of embedding entities and relations at the first attempt. We propose IIKE (Imperfect and Incomplete Knowledge Embedding), a probabilistic model which measures the probability of each belief, i.e. $\langle h,r,t angle$, in large-scale knowledge bases such as NELL and Freebase, and our objective is to learn a better low-dimensional vector representation for each entity ($h$ and $t$) and relation ($r$) in the process of minimizing the loss of fitting the corresponding confidence given by machine learning (NELL) or crowdsouring (Freebase), so that we can use $||{\bf h} + {\bf r} - {\bf t}||$ to assess the plausibility of a belief when conducting inference. We use subsets of those inexact knowledge bases to train our model and test the performances of link prediction and triplet classification on ground truth beliefs, respectively. The results of extensive experiments show that IIKE achieves significant improvement compared with the baseline and state-of-the-art approaches.

研究の動機と目的

  • Freebase や NELL のような大規模で不完全で不完全な知識リポジトリにおける知識推論の課題に対処すること。
  • 完全で真のラベルを伴う訓練データに依存する既存手法の限界を克服し、外部テキストソースを必要としないこと。
  • 関係固有のルールを必要とせず、グローバルな接続パターンを学習する統合的確率的埋め込みモデルを開発すること。
  • ベクトル類似度による信念の妥当性をモデル化することで、不完全な知識ベースにおける効果的な推論を可能にすること。
  • 完全でない訓練データのみを用いて、リンク予測およびトリプル分類の性能を向上させること。

提案手法

  • エンティティおよび関係の埋め込みに基づくスコア関数を用いて、トリプル ⟨h, r, t⟩ の妥当性を推定する確率的モデル IIKE を提案する。
  • NELL(ML)または Freebase(クラウドソーシング)からの実際の信頼度と予測信頼度の乖離を最小化する損失関数を用いる。
  • 確率的勾配降下法(SGD)の過程で偽のトリプルをサンプリングすることで、モデルの効率的訓練を実現するためのネガティブサンプリングを適用する。
  • エンティティ(h, t)および関係(r)の低次元ベクトル表現を学習し、||h + r - t|| が妥当性を測る指標とする。
  • ハイパーパrameter d(埋め込み次元)、α(学習率)、b(マージン)、norm(L1 または L2)を用いて、埋め込みを SGD で最適化する。
  • トリプル分類において、検証セット最適化により学習される関係固有の閾値 σr を用いて、トリプルを正例または負例に分類する。

実験結果

リサーチクエスチョン

  • RQ1真のラベルを伴わない訓練データに依存せずに、不完全で不完全な知識ベースから効果的に学習できる確率的埋め込みモデルは存在するか?
  • RQ2NELL および Freebase からの不正確な信念を用いて訓練された IIKE は、リンク予測およびトリプル分類でどの程度の性能を発揮するか?
  • RQ3NELL および Freebase からの信頼度スコアを学習信号として用いることで、真のラベルを用いたモデルに比べてより優れた一般化性能が得られるか?
  • RQ4関係固有のルール誘導を必要とせず、統一された埋め込み空間でグローバルな接続パターンを効果的に捉えることができるか?
  • RQ5精度および識別能力の観点から、TransE や TransH、NTN などの最先端モデルと比較して、IIKE はどの程度の性能を示すか?

主な発見

  • IIKE は FB15K トリプル分類ベンチマークで 91.1% の正確度を達成し、TransH(80.2%)、TransE(79.7%)、NTN(66.7%)を顕著に上回った。
  • NELL データセットでは、IIKE が 91.4% の正確度を達成し、TriplE(89.1%)および TransE(82.4%)を上回った。
  • IIKE の精度-再現率曲線は、AUC が TransH や TransE よりも大きいことを示し、優れたグローバルな識別能力を示している。
  • IIKE はリンク予測タスクにおいても強力な一般化性能を示し、FB15K および NELL の両方でベースラインおよび最先端手法を上回る性能を発揮した。
  • NELL および Freebase からの信頼度スコアを監視信号として用いることで、不完全でノイズの多い知識ベースでも効果的な学習が可能になった。
  • 異なる特性を有する2つの異なる知識ベースにおいてモデルの有効性が検証されたことから、その頑健性およびスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。