Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Bilingual: Multi-sense Word Embeddings using Multilingual Context

Shyam Upadhyay, Kai-Wei Chang|arXiv (Cornell University)|Jun 25, 2017
Topic Modeling参考文献 33被引用数 11
ひとこと要約

本稿では、多言語コーパスを活用して多義語埋め込みを学習する、多視点ベイジアン非パrametricモデルを提案する。このモデルにより、語の意味数をデータ駆動的に推定でき、固定された意味数の仮定を避けることでパrameterの無駄を削減する。英語をブリッジとして複数言語を同時に学習することで、二言語や単言語アプローチに比べて意味の区別性能が著しく向上し、5倍のデータで学習された最先端の単言語モデルと同等の性能を達成する。

ABSTRACT

Word embeddings, which represent a word as a point in a vector space, have become ubiquitous to several NLP tasks. A recent line of work uses bilingual (two languages) corpora to learn a different vector for each sense of a word, by exploiting crosslingual signals to aid sense identification. We present a multi-view Bayesian non-parametric algorithm which improves multi-sense word embeddings by (a) using multilingual (i.e., more than two languages) corpora to significantly improve sense embeddings beyond what one achieves with bilingual information, and (b) uses a principled approach to learn a variable number of senses per word, in a data-driven manner. Ours is the first approach with the ability to leverage multilingual corpora efficiently for multi-sense representation learning. Experiments show that multilingual training significantly improves performance over monolingual and bilingual training, by allowing us to combine different parallel corpora to leverage multilingual context. Multilingual training yields comparable performance to a state of the art mono-lingual model trained on five times more training data.

研究の動機と目的

  • 二言語のクロスリンガル手法が意味の区別に限界を示すのを是正し、多言語コーパスに拡張すること。
  • 固定された意味数の仮定を避けることでパrameterの無駄を減らすために、語ごとの意味数をデータ駆動的に推定できる仕組みを提供すること。
  • 英語を共通の参照点として複数言語の語の意味表現を同時にモデリングすることで、多義語表現の学習を向上させること。
  • 多言語学習が、はるかに少ない学習データで、大規模な単言語モデルと同等の性能を達成できることを示すこと。

提案手法

  • モデルはベイジアン非パrametricフレームワークを用い、単言語および多言語的文脈からの証拠に基づいて、語ごとに可変な意味ベクトル数を推定する。
  • 英語をブリッジとして、複数言語の語の意味表現を共通のベクトル空間にアライメントさせることで、同時に学習する。
  • クロスリンガル文脈ウィンドウを用いて、複数言語からの分布的信号を捉え、言語ごとに異なるウィンドウサイズを設定して信号の質を最適化する。
  • 複数の並列コーパス(例:En-Fr, En-Zh)を統合して1つの多言語学習コーパスを作成し、カバレッジと意味の区別力の両方を向上させる。
  • 言語ファミリーの影響を評価し、クロスリンガルウィンドウパラメータを最適化するために、中国語-英語-フランス語の並列コーパス(MultiUN)を用いる。
  • 意味推定にはディリクレ過程事前分布を用い、クロスリンガル証拠が支持する場合に限り、新しい意味ベクトルを動的に追加可能にする。

実験結果

リサーチクエスチョン

  • RQ1二言語信号のみに依存する場合と比べて、多言語的分布的情報が多義語埋め込みの質を著しく向上させ得るか?
  • RQ2近縁の言語ファミリー(例:インド・ヨーロッパ語族)ではなく、遠縁の言語ファミリー(例:サノチベータン語族)を用いることで、より良い意味の区別信号が得られるか?
  • RQ3クロスリンガルウィンドウサイズの選択が、異なる言語ペair間での意味クラスタリング性能にどのように影響するか?
  • RQ4可変な意味数をデータ駆動的に推定する非パrametricモデルが、固定された意味数のモデルに比べてデータ効率性と正確性の両面で優れているか?
  • RQ5多言語学習が、はるかに少ない学習データで、大規模な単言語モデルと同等の性能を達成できるか、その程度はどの程度か?

主な発見

  • 多言語学習は、単言語および二言語学習を著しく上回り、5倍のデータで学習された最先端の単言語モデルと同等の性能を達成する。
  • インド・ヨーロッパ語族ではなく、非インド・ヨーロッパ語族(例:中国語)をクロスリンガル信号として用いることで、わずかに優れた意味の区別性能が得られ、言語の距離が信号の多様性を高めることを示唆する。
  • クロスリンガルウィンドウサイズを拡大すると、一部の言語ペア(例:En-Zh)では性能が向上するが、他のペア(例:En-French)では性能が低下するため、言語に応じたウィンドウサイズのチューニングが不可欠であることが示された。
  • 主成分分析(PCA)の可視化により、多言語モデルが埋め込み空間において意味ベクトルをより明確にクラスタリングしていることが確認され、'bank'、'interest'、'apple'などの意味がはっきりと分離されている。
  • モデルは、データ駆動的に語ごとの意味数を可変に推定でき、過剰パラメータ化を回避し、効率性が向上した。
  • 複数の並列コーパスを統合することで、個々の二言語コーパスが小さくても、多言語的文脈を効果的に活用できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。