Skip to main content
QUICK REVIEW

[論文レビュー] Learning Rare Word Representations using Semantic Bridging

Victor Prokhorov, Mohammad Taher Pilehvar|arXiv (Cornell University)|Jul 24, 2017
Topic Modeling参考文献 18被引用数 4
ひとこと要約

本稿では、WordNet などのオントロジーからの語彙的知識と大規模コーパスからの分布的意味的空間を統合することで、希少語や未知語の単語埋め込みのカバレッジを向上させる手法を提案する。グラフ埋め込み(DeepWalk/node2vec)と多言語間ベクトル空間マッピング(最小二乗法、CCA)を用い、知識ベースの希少語表現をコーパスに基づくベクトル空間にマッピングすることで、語彙カバレッジが99%を超える結果が得られ、Rare Word Similarityデータセットにおける類似度性能が10%絶対的に向上した。

ABSTRACT

We propose a methodology that adapts graph embedding techniques (DeepWalk (Perozzi et al., 2014) and node2vec (Grover and Leskovec, 2016)) as well as cross-lingual vector space mapping approaches (Least Squares and Canonical Correlation Analysis) in order to merge the corpus and ontological sources of lexical knowledge. We also perform comparative analysis of the used algorithms in order to identify the best combination for the proposed system. We then apply this to the task of enhancing the coverage of an existing word embedding's vocabulary with rare and unseen words. We show that our technique can provide considerable extra coverage (over 99%), leading to consistent performance gain (around 10% absolute gain is achieved with w2v-gn-500K cf.§3.3) on the Rare Word Similarity dataset.

研究の動機と目的

  • 訓練頻度が低いことによる単語埋め込みの希少語・未知語表現の限界を解消すること。
  • WordNet などのオントロジーから得られる構造的語彙的知識と、大規模コーパスから導出される分布的意味的空間を統合すること。
  • 知識ベースの埋め込みをコーパス埋め込み空間にマッピングする転移学習フレームワークを構築し、語彙拡張を実現すること。
  • 希少語類似度の標準ベンチマーク上で、このアプローチの有効性を評価すること。
  • 低品質な埋め込みまたはマッピング技術を用いても、性能向上が達成されることを示すこと。

提案手法

  • WordNet 3.0 の知識ベースを DeepWalk や node2vec を用いて低次元ベクトル空間に埋め込み、シングレットをノード、意味的関係をエッジとして扱う。
  • 多言語間ベクトル空間マッピング技術(最小二乗法、線形判別分析)を適用し、知識ベースの埋め込み空間をコーパスベースの意味的空間(例:GloVe や w2v-gn)に一致させる。
  • MaxSim仮定を用いて、WordNet 内で最も代表的なシングレットに単語をマッピングすることで、語レベルの整合性を実現する。
  • 学習された線形マッピングを介して、知識ベース空間の希少語・未知語ベクトルをコーパス埋め込み空間に変換する。
  • 得られた拡張済み埋め込みを、類似度評価などの下流タスクに適用し、性能向上を評価する。
  • GloVe や w2v-gn といった複数の埋め込みモデルと、LS や CCA といったマッピング技術の組み合わせを比較し、最適な構成を同定する。

実験結果

リサーチクエスチョン

  • RQ1知識ベースの埋め込みを、コーパスベースの単語埋め込みと効果的に一致させることで、希少語・未知語のカバレッジを向上させることができるか?
  • RQ2グラフ埋め込み(DeepWalk, node2vec)とベクトル空間マッピング(LS, CCA)のどの組み合わせが、希少語表現において最良の性能を達成するか?
  • RQ3WordNet からの語彙拡張が、Rare Word Similarity データセットにおける性能にどの程度向上をもたらすか?
  • RQ4異なる事前学習済み埋め込みを用いた場合、提案手法を用いることで性能向上が統計的に有意であるか?
  • RQ5本手法は、分布的コーパス情報を利用して知識ベースを拡張するために逆方向に適用可能か?

主な発見

  • 提案手法により、WordNet からの希少語を統合することで、Rare Word Similarity データセットにおける語彙カバレッジが99%を超えた。
  • w2v-gn-500K モデルは、拡張後、スピアマン順位相関係数が0.42から0.44に10%の絶対的向上を示し、最大の性能向上を達成した。
  • 全テスト済み埋め込み(w2v-gn, w2v-gn-500K, GloVe)が、拡張後、ピアソンおよびスピアマン相関係数の両方で一貫した性能向上を示した。
  • 一側検定t検定による有意性評価(p < 0.05)で、性能向上が統計的に有意であることが確認され、異なる構成でも安定性が裏付けられた。
  • 形態素構造を持たない単一語素の希少語に対しても、本手法は効果的に埋め込みを誘導でき、形態素合成モデルの限界を克服した。
  • 低品質なKB埋め込みやマッピング技術を用いても、本手法は有効であることが示され、汎用性と耐性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。