Skip to main content
QUICK REVIEW

[論文レビュー] Word2vec Skip-gram Dimensionality Selection via Sequential Normalized Maximum Likelihood

Pham Thuc Hung, Kenji Yamanishi|arXiv (Cornell University)|Aug 18, 2020
Natural Language Processing Techniques参考文献 25被引用数 5
ひとこと要約

本稿では、語彙ベクトルのスキップグラムモデルにおける最適次元の選択に、情報量基準に基づく新規手法を提案する。順次正規化最大尤度(SNML)基準を用い、word2vecを真の文脈的分布の推定問題として定式化することで、真の文脈的分布に最も近い次元を特定する。実験的評価では、AIC、BIC、交差検証、PIPと比較して、合成データおよび実世界のNLPタスクの両方で優れた性能を示した。

ABSTRACT

In this paper, we propose a novel information criteria-based approach to select the dimensionality of the word2vec Skip-gram (SG). From the perspective of the probability theory, SG is considered as an implicit probability distribution estimation under the assumption that there exists a true contextual distribution among words. Therefore, we apply information criteria with the aim of selecting the best dimensionality so that the corresponding model can be as close as possible to the true distribution. We examine the following information criteria for the dimensionality selection problem: the Akaike Information Criterion, Bayesian Information Criterion, and Sequential Normalized Maximum Likelihood (SNML) criterion. SNML is the total codelength required for the sequential encoding of a data sequence on the basis of the minimum description length. The proposed approach is applied to both the original SG model and the SG Negative Sampling model to clarify the idea of using information criteria. Additionally, as the original SNML suffers from computational disadvantages, we introduce novel heuristics for its efficient computation. Moreover, we empirically demonstrate that SNML outperforms both BIC and AIC. In comparison with other evaluation methods for word embedding, the dimensionality selected by SNML is significantly closer to the optimal dimensionality obtained by word analogy or word similarity tasks.

研究の動機と目的

  • 最適なword2vec スキップグラム次元の選択に、データ駆動型かつ評価データセットに依存しない手法が不足しているという問題に取り組む。
  • 情報量基準(特にSNML、AIC、BIC)を、word2vecモデルにおける次元選択に適用する。
  • 計算コストの高いSNMLコード長の計算に効率的なヒューリスティクスを開発する。
  • 語の類似性および類推タスクにおける最適次元に近いかどうかを実験的に検証し、SNMLが既存の手法よりも優れていることを確認する。
  • 尤度に基づくNML/SNML計算を定義することで、他の埋め込みモデルに一般化可能なフレームワークを構築する。

提案手法

  • 真の文脈的分布の仮定の下で、word2vec スキップグラムを暗黙の確率分布推定問題として定式化する。
  • AIC、BIC、SNMLといった情報量基準を用い、真の分布からのモデルの乖離を最小化する次元を選択する。
  • SNMLコード長計算の計算コストを低減するための新規ヒューリスティクスを導入し、実用的利用を可能にする。
  • オリジナルスキップグラム(oSG)およびネガティブサンプリングを用いたスキップグラム(SGNS)モデルを用い、モデルのバリエーションにわたる手法の有効性を検証する。
  • oSGおよびSGNSの尤度関数を用い、NMLおよびSNMLコード長を計算し、モデル比較に用いる。
  • SNML基準を用い、モデルの適合度と複雑さの両立を最適化する次元を選択する。

実験結果

リサーチクエスチョン

  • RQ1SNMLなどの情報量基準は、word2vec スキップグラムモデルにおける次元選択に効果的に適用可能か?
  • RQ2SNMLは、AIC、BIC、交差検証、PIPと比較して、NLPタスクにおける最適性能と整合する次元選択をどの程度効果的に行えるか?
  • RQ3SNMLの計算コストを実用的レベルに抑えるための効率的ヒューリスティクスを開発可能か?
  • RQ4SNMLによる次元選択は、語の類似性および類推タスクで特定された最適次元に近いか?
  • RQ5尤度関数を定義することで、本手法を他の埋め込みモデルに一般化可能か?

主な発見

  • SNMLは、語の類似性および類推タスクにおける最適次元に著しく近い次元を選択する点で、AIC、BIC、交差検証、PIPを上回った。
  • 合成データでは、SNMLで選択された次元が真の分布に最も近い文脈的分布を生成し、理論的妥当性を裏付けた。
  • 実際のテキストデータセットでは、SGNSでは4つのタスク(WA、WS、MEN、MTurk)すべてでSNMLがAIC、BIC、CV、PIPよりも最適次元に近い次元を選択した。oSGでは3つのタスクで同様の結果を得た。
  • SNML基準は一貫して、過剰適合を効果的にペナルティとして課しつつ、高い性能を維持する、低いが十分な次元を選好する。
  • 提案されたヒューリスティクスにより、SNMLコード長の実用的計算が可能となり、SNMLを単語埋め込みに適用する際の主要な障壁を克服した。
  • 本手法は、手作業で作成された評価データセットに依存せずに情報量基準を単語埋め込みの次元選択に適用した初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。