Skip to main content
QUICK REVIEW

[論文レビュー] "The Sum of Its Parts": Joint Learning of Word and Phrase Representations with Autoencoders

Rémi Lebret, Ronan Collobert|arXiv (Cornell University)|Jun 18, 2015
Topic Modeling参考文献 27被引用数 6
ひとこと要約

本稿では、自己符号化器を用いた共同学習フレームワークを提案し、語の表現とそれらの構成的フレーズ表現を平均化によって同時に学習する。語の共起統計と確率的最適化を用いた低ランク近似を活用することで、フレーズレベルのベクトルから語を再構築する能力を学習し、新しいフレーズ検索タスクにおいて最先端の性能を達成するとともに、標準的な語評価ベンチマークでも競争力のある結果を得た。

ABSTRACT

Recently, there has been a lot of effort to represent words in continuous vector spaces. Those representations have been shown to capture both semantic and syntactic information about words. However, distributed representations of phrases remain a challenge. We introduce a novel model that jointly learns word vector representations and their summation. Word representations are learnt using the word co-occurrence statistical information. To embed sequences of words (i.e. phrases) with different sizes into a common semantic space, we propose to average word vector representations. In contrast with previous methods which reported a posteriori some compositionality aspects by simple summation, we simultaneously train words to sum, while keeping the maximum information from the original vectors. We evaluate the quality of the word representations on several classical word evaluation tasks, and we introduce a novel task to evaluate the quality of the phrase representations. While our distributed representations compete with other methods of learning word representations on word evaluations, we show that they give better performance on the phrase evaluation. Such representations of phrases could be interesting for many tasks in natural language processing.

研究の動機と目的

  • 語の分散表現とそれらの構成的フレーズ表現を統合的に学習するモデルの開発。
  • 共通の意味的空間内で語ベクトルが意味的に加法的となるようにすることで、フレーズ表現の質を向上させること。
  • 再トレーニングなしに、共起統計に基づいて新しいフレーズ表現を効率的に推論できること。
  • フレーズベクトルから構成語を再構築するという新しいタスクとしての、フレーズ表現の評価。
  • 共同学習された表現が、標準的な語埋め込みモデルよりも複雑な線形部分構造をよりよく捉えられることの実証。

提案手法

  • 無作為なテキストから語の共起行列の低ランク近似を用いて、初期の語ベクトル表現を学習する。
  • 確率的最適化プロセスを用い、語ベクトルを同時にトレーニングするとともに、それらの平均化されたベクトル表現から元の語を再構築する能力を学習する。
  • フレーズ表現は、その構成語のベクトル表現の平均化によって形成され、可変長のフレーズが共通の意味的空間に埋め込まれる。
  • 自己符号化器アーキテクチャを用いて、フレーズベクトルが元の語を再構築できることを制約することで、意味的な構成的構造を学習する。
  • 2つの推論モードをサポートする:(1) 知られている語ベクトルの平均化、(2) 共起統計に基づいた学習済み符号化関数による未学習語やフレーズの処理。
  • 事前に計算された共起回数を活用することで、再トレーニングなしに効率的かつ低メモリで新しいフレーズ表現を推論可能となる。

実験結果

リサーチクエスチョン

  • RQ1語とフレーズ表現の共同学習は、フレーズレベルの意味的ベクトルの質を向上させることができるか?
  • RQ2平均化されたフレーズベクトルから語を再構築する学習は、標準的な語埋め込みモデルと比較して、より優れた構成的表現を生み出すか?
  • RQ3共起統計のみを用いて、新しいフレーズや未学習語に一般化できるか?
  • RQ4語レベルおよびフレーズレベルの評価タスクにおいて、最先端手法と比較して本モデルの性能はどの程度か?
  • RQ5ベクトル平均化と共起統計に基づく符号化という2つの推論戦略は、異なるが意味のあるフレーズ表現を生み出すか?

主な発見

  • 標準的な語類似度および類推タスクにおいて、本モデルは競争力のある性能を示しており、共同学習が高品質な語表現を保持していることを裏付けた。
  • フレーズベクトルから構成語を再構築するという新しいフレーズ評価タスクにおいて、GloVe や word2vec といった最先端手法を顕著に上回った。
  • 長いフレーズに対しても本モデルは強い性能を維持するが、GloVe は2項共起比に依存しているため、フレーズ長が増えると性能が低下する。
  • 2つの推論戦略であるベクトル平均化と共起統計に基づく符号化は、異なるが意味のあるフレーズ表現を生成し、それぞれが異なる意味的側面(例:エンティティの類似性 vs. 情報含量)を捉えている。
  • 再トレーニングなしに、語の共起回数のみを用いて、効率的かつ低メモリで新しいフレーズ表現を推論可能である。
  • 学習済みの符号化関数により、大規模コーパス内の文脈語のカウントに基づいて、未学習の語やフレーズの効果的な表現が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。