Skip to main content
QUICK REVIEW

[論文レビュー] Co-occurrences using Fasttext embeddings for word similarity tasks in Urdu

Usama Khalid, Aizaz Hussain|arXiv (Cornell University)|Feb 22, 2021
Topic Modeling参考文献 25被引用数 7
ひとこと要約

本稿では、大規模で洗練されたウルドゥー語コーパス(COUNTER)を用いてトレーニングされたFastTextおよびn-gram単語埋め込みを提案し、低リソース言語としてのウルドゥー語NLPにおける単語類似度タスクの改善を図る。FastTextはSimLex-999で既存のスキップグラム埋め込みを上回る性能(Spearman r = 0.743)を示したが、WordSim-353では性能が劣ることから、英語モデルと同等の性能を達成するには、より大規模で高品質なウルドゥー語コーパスの構築が不可欠であることが示された。

ABSTRACT

Urdu is a widely spoken language in South Asia. Though immoderate literature exists for the Urdu language still the data isn't enough to naturally process the language by NLP techniques. Very efficient language models exist for the English language, a high resource language, but Urdu and other under-resourced languages have been neglected for a long time. To create efficient language models for these languages we must have good word embedding models. For Urdu, we can only find word embeddings trained and developed using the skip-gram model. In this paper, we have built a corpus for Urdu by scraping and integrating data from various sources and compiled a vocabulary for the Urdu language. We also modify fasttext embeddings and N-Grams models to enable training them on our built corpus. We have used these trained embeddings for a word similarity task and compared the results with existing techniques.

研究の動機と目的

  • ウルドゥー語——リソースが限られる低リソース言語——における高品質で公開可能な単語埋め込みの不足を解消すること。
  • 複数のパキスタンのニュース機関から得た1200件のニュースドキュメントを統合し、堅固な単語埋め込みトレーニングを可能にする大規模で統合されたウルドゥー語コーパスを構築すること。
  • ウルドゥー語の変形語彙的複雑性に対応するため、前処理およびハイパーパrameterの調整を施したFastTextおよびn-gramモデルをウルドゥー語に適応させること。
  • 標準的な単語類似度ベンチマーク(SimLex-999およびWordSim-353)を用いて、トレーニング済み埋め込みの性能を評価し、既存のスキップグラムモデルと比較すること。
  • トレーニング済み埋め込み、コード、およびデータセットをGitHubに公開し、ウルドゥー語自然言語処理分野の研究を促進すること。

提案手法

  • パキスタンの複数のニュース機関から得た1200件のニュースドキュメントをウェブスクレイピングし、統合することで大規模なウルドゥー語コーパス(COUNTER)を構築した。
  • 文に分割し、トークン化し、カスタムおよび組み込みのFastTextツールを用いてストップワードを除去することで、コーパスを前処理した。
  • デフォルトのハイパーパrameterを用いてFastText埋め込みをトレーニングした:ベクトル次元 = 100、エポック数 = 5、初期学習率 = 0.05、サブワードn-gram長 = 3–6。
  • n-gramモデルは、連続する単語数(n-grams)のみをハイパーパrameterとして用い、単語共起パターンに焦点を当てた。
  • Spearmanの順位相関係数を用いて、予測された類似度スコアと人間がアノテートしたスコアの間の相関を評価し、ウルドゥー語に翻訳されたSimLex-999およびWordSim-353データセット上でモデル性能を評価した。
  • 評価用に、iJuniorの翻訳サービスを用いて英語のSimLex-999およびWordSim-353データセットをウルドゥー語に翻訳した。

実験結果

リサーチクエスチョン

  • RQ1大規模で洗練されたウルドゥー語コーパスを用いてトレーニングされたFastText埋め込みは、既存のスキップグラムモデルを上回り、ウルドゥー語の単語類似度タスクで優れた性能を示せるか?
  • RQ2n-gramベースの単語共起モデルは、ウルドゥー語の単語類似度の文脈において、分散型埋め込みと比較してどの程度の性能を示すか?
  • RQ3提案されたウルドゥー語単語埋め込みは、標準的な類似度ベンチマークで、事前学習済み英語FastText埋め込みの性能にどの程度近づけるか?
  • RQ4コーパスのサイズと品質は、ウルドゥー語のような低リソース言語における単語埋め込みの有効性にどのような影響を及えるか?

主な発見

  • FastText埋め込みは、ウルドゥー語に翻訳されたSimLex-999データセットでSpearman相関係数0.743を達成し、スキップグラムベースライン(r = 0.293)を上回った。
  • n-gramモデルはSimLex-999で低水準の相関係数0.156、WordSim-353では0.188を示し、ウルドゥー語の単語類似度タスクにおいて有効性が限定的であることが示された。
  • WordSim-353ではFastText埋め込みがスキップグラムモデルをわずかに下回った(r = 0.462 vs. 0.492)、これはタスク依存の性能差が生じることを示唆している。
  • ウルドゥー語におけるFastText埋め込みは、英語FastTextの性能(r = 0.84)と比較して依然として顕著に劣っており、さらなる改善の余地が大きいことが示された。
  • 本研究では、適切な前処理とコーパスの洗練を経て、FastTextがウルドゥー語に効果的に適応可能であることが実証され、SimLex-999でSOTA成績を達成した。
  • 著者らは、再現可能性と今後のウルドゥー語NLP研究を支援する目的で、トレーニング済み埋め込み、コード、およびデータセットをGitHubに公開した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。