Skip to main content
QUICK REVIEW

[論文レビュー] Vector Embedding of Wikipedia Concepts and Entities

Ehsan Sherkat, Evangelos Milios|arXiv (Cornell University)|Feb 12, 2017
Topic Modeling参考文献 14被引用数 9
ひとこと要約

本論文では、Wikipediaのリンク構造とコンテンツを活用して、曖昧さのない文脈に適応した埋め込みを生成する、低次元のベクトル表現を学習するためのConVecという手法を提案する。この手法は、概念類似性および類推タスクにおいて最先端または同等の性能を達成しており、高品質な概念埋め込みの観点から、コーパスの質がサイズよりも重要であることを示している。

ABSTRACT

Using deep learning for different machine learning tasks such as image classification and word embedding has recently gained many attentions. Its appealing performance reported across specific Natural Language Processing (NLP) tasks in comparison with other approaches is the reason for its popularity. Word embedding is the task of mapping words or phrases to a low dimensional numerical vector. In this paper, we use deep learning to embed Wikipedia Concepts and Entities. The English version of Wikipedia contains more than five million pages, which suggest its capability to cover many English Entities, Phrases, and Concepts. Each Wikipedia page is considered as a concept. Some concepts correspond to entities, such as a person's name, an organization or a place. Contrary to word embedding, Wikipedia Concepts Embedding is not ambiguous, so there are different vectors for concepts with similar surface form but different mentions. We proposed several approaches and evaluated their performance based on Concept Analogy and Concept Similarity tasks. The results show that proposed approaches have the performance comparable and in some cases even higher than the state-of-the-art methods.

研究の動機と目的

  • 従来の単語埋め込みとは異なり、曖昧でない、濃密なベクトル表現を学習する手法を開発すること。
  • より小さく高品質なコーパスが、より大きくノイズの多いコーパスよりも優れた概念埋め込みをもたらすかどうかを評価すること。
  • 特にWikipediaのアンカーリンクとヒューリスティックな曖昧性解消を用いた異なる埋め込み戦略の、標準ベンチマークタスクにおける性能を比較すること。
  • 事前学習済み単語ベクトルが、概念埋め込みモデルの微調整に与える影響を調査すること。
  • 研究利用を目的として、大規模かつ高カバレッジのWikipediaの概念および単語ベクトルの公開を実施すること。

提案手法

  • 本手法は、Word2Vecに類似したネガティブサンプリングを用いたスキップグラムに基づく深層学習フレームワークを用い、テキスト的文脈からWikipediaの概念のベクトル表現を学習する。
  • 各Wikipediaページを固有の概念とみなしその埋め込みを、周囲の単語およびアンカーリンク(他のWikipediaページへのハイパーリンク)から学習する。
  • ヒューリスティックな曖昧性解消戦略により、曖昧な語を最も頻出するWikipediaの概念にマッピングすることで、精度を損なわずカバレッジを向上させる。
  • モデルは21億トークンのWikipediaダンプを用いて学習され、性能向上のため、より大きなコーパスからの事前学習済み単語ベクトルを初期化に用いる。
  • 単語と概念の両方を統一されたベクトル空間に統合することで、統合的意味解析を可能にする。
  • モデルの変種として、周囲のテキストを除いたアンカーリンクのみを用いることで、リンク構造そのものの貢献度を評価する。

実験結果

リサーチクエスチョン

  • RQ1より小さく高品質なWikipediaコーパスを用いることで、よりノイズの多い大規模コーパスを用いる場合よりも優れた概念埋め込みが得られるか?
  • RQ2語の異なる意味が別々のベクトルで表現される曖昧でない概念埋め込みは、類似性や類推などのNLPタスクの性能向上に寄与するか?
  • RQ3事前学習済み単語ベクトルを用いた微調整は、Wikipediaの概念埋め込みの品質にどのように影響するか?
  • RQ4テキスト的文脈と比較して、Wikipediaのリンク構造(アンカーリンク)が、効果的な概念表現にどの程度貢献するか?
  • RQ5ヒューリスティックな曖昧性解消は、性能の低下を最小限に抑えつつ、概念埋め込みのカバレッジを向上させることができるか?

主な発見

  • ConVecモデルは、WS-SIMデータセットにおいてSpearman相関係数0.7596を記録し、概念類推タスクで最先端または同等の性能を達成した。
  • フレーズ類似性タスクにおいて、ヒューリスティックな曖昧性解消を用いたConVecモデルは、全データセットで平均Spearman相関係数0.5054を達成し、複数のベースラインを上回った。
  • Googleの1000億トークンのFreebaseデータセットよりも小さい21億トークンのWikipediaダンプを用いたモデルが、より大きなコーパスを上回った。これは、コーパスの質がサイズよりも重要であることを示している。
  • ヒューリスティックな曖昧性解消法は、性能の低下を最小限に抑えつつカバレッジを向上させた。これは、精度を損なわず拡張可能な埋め込みが実現可能であることを示している。
  • テキストを除いたアンカーリンクのみを用いたConVecのバージョンは、全体として完全な文脈を用いたモデルより性能が低く、テキスト的文脈がリンク構造単体よりも情報量が多いことを示している。
  • モデルの性能は、Wikipedia Miner や HitSim といった構造的アプローチと同等であり、Wikipediaのリンクに基づく意味的構造を効果的に捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。