Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Non-parametric Estimation of Multiple Embeddings per Word in Vector Space

Arvind Neelakantan, Jeevan Shankar|arXiv (Cornell University)|Apr 24, 2015
Topic Modeling参考文献 12被引用数 5
ひとこと要約

本稿では、トレーニング中に文脈ベクトルを最も近い意味ベクトルに動的に割り当てることで、1語のタイプごとに複数の単語埋め込みを同時に学習する Multiple-sense Skip-gram (MSSG) およびその非パrametric版 NP-MSSG を提案する。この手法は、文脈内語彙類似度(SCWS)および WordSim-353 タスクで最先端の性能を達成しており、10億トークン近くを1台のマシンで6時間未満でトレーニング可能であり、従来の手法に比べてスケーラビリティと意味に配慮した表現が向上している。

ABSTRACT

There is rising interest in vector-space word embeddings and their use in NLP, especially given recent methods for their fast estimation at very large scale. Nearly all this work, however, assumes a single vector per word type ignoring polysemy and thus jeopardizing their usefulness for downstream tasks. We present an extension to the Skip-gram model that efficiently learns multiple embeddings per word type. It differs from recent related work by jointly performing word sense discrimination and embedding learning, by non-parametrically estimating the number of senses per word type, and by its efficiency and scalability. We present new state-of-the-art results in the word similarity in context task and demonstrate its scalability by training with one machine on a corpus of nearly 1 billion tokens in less than 6 hours.

研究の動機と目的

  • 単一ベクトル表現の限界を克服するため、語の意味多義性を扱うために、1語タイプごとに複数の意味特徴ベクトルを学習すること。
  • 意味の識別と埋め込み学習を同時に実行することで、2段階のクラスタリングと再トレーニング手法よりも精度を向上させること。
  • 固定された意味数の仮定を避けるために、語タイプごとの意味数を非パrametric的に推定できること。
  • 大規模コーパス(例:10億トークン)を1台のマシンで6時間未満でトレーニングできる高スケーラビリティと効率性を実現すること。
  • 従来の複数表現モデルと比較して、語彙類似度および類推タスクでの性能向上を示すこと。

提案手法

  • オンライントレーニング中に、文脈平均に基づいて最も近い意味ベクトルにのみ更新するように、1語タイプごとに複数のベクトルを維持するスキップグラムモデルの拡張。
  • 勾配更新の際、与えられたトークンに対して、文脈語ベクトルの平均を用いて最も関連性の高い意味ベクトルを選択する。
  • NP-MSSGでは、既存の意味に最も近いものからの距離に比例する確率で、新たなクラスタ(意味)を生成する施設配置メカニズムを採用する。
  • 文脈ベクトルが既存の意味ベクトルから十分に離れている場合にのみ、動的に新しい意味ベクトルを追加することで、語タイプごとの意味数を非パrametric的に推定する。
  • すべてのパラメータをエンドツーエンドでオンラインかつ確率的最適化フレームワークでトレーニングすることで、大規模コーパスへのスケーラビリティを実現する。
  • 埋め込み次元数と意味数を性能最適化のために調整しながら、上位30,000語の頻出語に対して複数の埋め込みを学習する。

実験結果

リサーチクエスチョン

  • RQ1意味の識別と埋め込み表現の共同学習は、文脈内語彙類似度タスクの性能向上に寄与するか?
  • RQ2事前の仮定なしに、非パrametric手法が適切な語の意味数を自動で発見できるか?
  • RQ3従来の2段階手法と比較して、本手法は10億トークンのような大規模コーパスに対しても効率的にスケーリングできるか?
  • RQ4語彙類似度および類推タスクにおいて、本手法は従来の最先端モデルと比較してどの程度の性能を示すか?
  • RQ5ノイズが存在する中でも、頻出語に対して複数の埋め込みを学習する際に、本手法は頑健性を保てるか?

主な発見

  • MSSGモデルは、avgSimC指標を用いてSCWSタスクで69.3%という新記録を達成し、従来の最先端(65.7%)を上回った。
  • WordSim-353タスクでは、avgSim指標で71.2%を達成し、従来の複数表現学習向けニューラルネットワークモデルを上回った。
  • NP-MSSGモデルは、語ごとに可変な数の意味を学習し、図3に示す分布から、効果的な非パrametric的意味発見が行われたことが示された。
  • モデルは1台のマシンで10億トークン近くを6時間未満でトレーニング可能であり、従来の手法が1週間を要したのに対し、27倍の高速化が達成された。
  • Google類推タスクでは、MSSGおよびNP-MSSGが64%の精度を達成し、従来手法(12%)を著しく上回り、スキップグラムの67%に近づいた。
  • 埋め込み次元数が高くなるほど性能が向上し、MSSGは300次元でSCWSのavgSimCが69.2%を達成し、スケーラビリティと有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。