Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Morphological Expansion of Small Datasets for Improving Word Embeddings

Syed Sarfaraz Akhtar, Arihant Gupta|arXiv (Cornell University)|Nov 15, 2017
Topic Modeling参考文献 18被引用数 3
ひとこと要約

本論文は、低リソースデータセットの語彙的拡張を用いて人工文を生成することで、単語埋め込みを向上させる非教師ありで言語に依存しない手法を提案する。これらの合成文で訓練することで、希少語や低頻度語の埋め込みが向上し、特にヒンディ語 や ドイツ語 のような語彙的豊富な言語において、はるかに大きなコーパスで訓練されたモデルと同等の性能を達成する。

ABSTRACT

We present a language independent, unsupervised method for building word embeddings using morphological expansion of text. Our model handles the problem of data sparsity and yields improved word embeddings by relying on training word embeddings on artificially generated sentences. We evaluate our method using small sized training sets on eleven test sets for the word similarity task across seven languages. Further, for English, we evaluated the impacts of our approach using a large training set on three standard test sets. Our method improved results across all languages.

研究の動機と目的

  • 低リソース言語および語彙的に豊富な言語における単語埋め込み学習のデータスパarsity問題に対処すること。
  • 外部の語彙解析ツールに依存せずに、希少語や未知語の単語埋め込みを改善すること。
  • 言語に依存しない非教師あり手法を構築し、語彙的規則を用いて人工的なトレーニング文を生成すること。
  • 語彙的拡張が、はるかに大きなデータセットで訓練された埋め込みと同等の結果をもたらすことを実証すること。
  • 低リソース環境での評価を支援するため、新しいヒンディ語の語の類似度データセット(Hin-WS235)を公開すること。

提案手法

  • トレーニングコーパス内の語に語彙的変換(例:接尾語・接頭語の付加)を適用することで、非教師あり語彙的拡張を実行し、人工文を生成する。
  • 単語埋め込みの学習に、ネガティブサンプリングを用いたSkip-gramモデルを採用し、固定されたハイパーパrameter(d=500, min_count=5)を設定する。
  • 頻度の高い語彙的変形語を探索することで、希少語や未知語の埋め込みを回復するための階層的語彙照合戦略(「Morph」ステップ)を実装する。
  • 直接照合に失敗した場合に、大文字化と長さに基づくヒューリスティクスを適用して埋め込み回復を改善する。
  • 複数の語彙的変形語が利用可能な場合、頻度と長さをターミネートの基準として用いる。
  • 語彙的拡張と単語埋め込み学習を統合することで、低頻度語の表現を向上させる。

実験結果

リサーチクエスチョン

  • RQ1小規模コーパスの語彙的拡張は、特に語彙的に豊富な言語において、複数の言語で単語埋め込みの質を向上させることができるか?
  • RQ2本手法は、はるかに大きなコーパスで訓練された最先端モデルと比較して、語の類似度性能においてどのように差をつけるか?
  • RQ3語彙的規則に基づいて生成された人工文は、希少語や未知語におけるデータスパarsityを緩和するか?
  • RQ4なぜ本手法はアラビア語では効果が低く、その制限要因として言語的要因は何か?
  • RQ5語彙的拡張は、ベクトル空間における類推的正規性をどの程度維持するか?

主な発見

  • 本手法は、7つの言語で小規模コーパス上での語の類似度性能を顕著に向上させ、語彙的に豊富な言語(例:ヒンディ語、ドイツ語)で最も大きな向上が観察された。
  • 英語では、SG + Exp + Morphを用いたモデルがStanford Rare-Word(RW)データセットで47.9を達成し、ベースラインのSGモデル(42.1)を上回り、420億トークンで学習されたモデルと同等の結果を示した。
  • RG65データセットでは、SG + Exp + Morphで80.4の精度を達成し、420億トークンで学習されたGloVe(82.9)を上回ったが、使用したトークン数は10億にとどまった。
  • WS353データセットでは、拡張により精度がわずかに低下した。これは、文法的に誤った人工文が類推的正規性を破壊したためと推測される。
  • 頻度と長さのヒューリスティクスを適用することで、語彙的変形語照合による希少語の埋め込み回復が強く効果を示した。
  • 本手法はアラビア語では効果が低く、これは現在の接頭語/接尾語ベースの拡張戦略が、アラビア語の複雑な中置き接頭語(infixation)パターンをうまく処理できないためとされる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。