Skip to main content
QUICK REVIEW

[論文レビュー] Controlled Experiments for Word Embeddings

Benjamin J. Wilson, Adriaan M. J. Schakel|arXiv (Cornell University)|Oct 9, 2015
Topic Modeling参考文献 11被引用数 13
ひとこと要約

本論文は、語の頻度と共起ノイズの影響を分離するため、変更された学習コーパスを用いた制御実験を提案する。語の頻度とノイズレベルを調整可能な擬似語を挿入することで、著者らはベクトル長が両要因に対して線形的に変化することを示した。また、純粋なノイズのベクトルはゼロでないが小さいことから、特徴空間に原点でない特別な点が存在することが明らかになった。

ABSTRACT

An experimental approach to studying the properties of word embeddings is proposed. Controlled experiments, achieved through modifications of the training corpus, permit the demonstration of direct relations between word properties and word vector direction and length. The approach is demonstrated using the word2vec CBOW model with experiments that independently vary word frequency and word co-occurrence noise. The experiments reveal that word vector length depends more or less linearly on both word frequency and the level of noise in the co-occurrence distribution of the word. The coefficients of linearity depend upon the word. The special point in feature space, defined by the (artificial) word with pure noise in its co-occurrence distribution, is found to be small but non-zero.

研究の動機と目的

  • 単語埋め込みにおける語の頻度と共起ノイズの独立した影響が、単語ベクトルの性質に与える影響を分離すること。
  • 語の頻度と共起ノイズの両要因が、制御可能で測定可能な方法で単語ベクトルの長さと方向に系統的に影響を与えるかどうかを調査すること。
  • 『純粋なノイズ』の単語ベクトルが存在するか、そしてそれが特徴空間の原点にあるか、それとも非ゼロの点にあるかを特定すること。
  • モデルの内部構造にアクセスせずに、コーパスレベルの修正によって任意の単語埋め込みモデルに適用可能な一般化可能な実験フレームワークを提供すること。

提案手法

  • 制御された頻度と変動する共起ノイズレベルを持つ擬似語を学習コーパスに挿入する。
  • 擬似語の共起分布を固定したまま頻度を変化させることで、頻度要因の影響を分離する。
  • 頻度を一定に保ちながら、共起分布におけるノイズの割合を増加させることで、ノイズ要因の影響を分離する。
  • 修正されたコーパス上でword2vec CBOWモデルを学習し、最初の(syn0)および2番目の(syn1neg)シナプス層からの単語ベクトルを抽出する。
  • コサイン類似度とベクトル長の分析を用いて、頻度とノイズに対する方向性と大きさの変化を検討する。
  • 特徴空間における特別な点を特定するため、擬似語のベクトルを『VOID』語(純粋なバックグラウンドノイズを表す)と比較する。

実験結果

リサーチクエスチョン

  • RQ1共起分布を一定に保った場合、語の頻度が増加するにつれて単語ベクトル長はどのように変化するか?
  • RQ2頻度を一定に保った場合、共起ノイズが増加するにつれて単語ベクトル長はどのように変化するか?
  • RQ3共起分布に純粋なノイズが含まれる語(VOID)のベクトルは、特徴空間の原点にあるか?
  • RQ4共起ノイズが増加するにつれて、単語ベクトルの方向はどのように滑らかに変化するか?
  • RQ5純粋なノイズを持つ擬似語のベクトルは、特徴空間における安定した非ゼロのアトラクターとして解釈できるか?

主な発見

  • 共起ノイズを一定に保った場合、語の頻度に伴い単語ベクトル長はほぼ線形的に変化する。
  • 頻度を一定に保った場合、共起ノイズが増加するにつれて単語ベクトル長は線形に減少し、その傾きは語によって異なる。
  • 純粋なノイズを持つ擬似語(VOID)のベクトルは小さくはあるがゼロでないため、特徴空間に原点でない特別な点が存在することが示された。
  • 共起ノイズが増加するにつれて、単語ベクトルの方向は元の単語ベクトルから、ほぼ垂直な方向へ滑らかに内挿される。
  • 純粋なノイズ語(VOID)のベクトルは、ノイズが増加する擬似語のベクトルに対して共通のアトラクターとして機能するが、VOIDの完全な文脈が十分にサンプリングされていないため収束は限定的である。
  • 1番目のシナプス層(syn0)におけるベクトル長は、2番目の層(syn1neg)よりも頻度およびノイズとの線形関係がより強く現れる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。