[論文レビュー] Word Embedding based New Corpus for Low-resourced Language: Sindhi
本稿では、ウェブスクリーピングにより収集され、ノイズの多いデータに対処するため厳密に前処理が施された大規模な6100万語のシンディ語コーパスを紹介する。このコーパスを用いて、最先端のモデル(Skip-gram、CBOW、GloVe)を用いて高品質な単語埋め込みを学習可能であり、内在的評価において既存のSdfastText表現を上回る性能を示した。特に、Skip-gramは意味的類似性および語の類似性タスクで最良の性能を達成し、低リソース言語としてのシンディ語NLP分野における顕著な前進を示している。
Representing words and phrases into dense vectors of real numbers which encode semantic and syntactic properties is a vital constituent in natural language processing (NLP). The success of neural network (NN) models in NLP largely rely on such dense word representations learned on the large unlabeled corpus. Sindhi is one of the rich morphological language, spoken by large population in Pakistan and India lacks corpora which plays an essential role of a test-bed for generating word embeddings and developing language independent NLP systems. In this paper, a large corpus of more than 61 million words is developed for low-resourced Sindhi language for training neural word embeddings. The corpus is acquired from multiple web-resources using web-scrappy. Due to the unavailability of open source preprocessing tools for Sindhi, the prepossessing of such large corpus becomes a challenging problem specially cleaning of noisy data extracted from web resources. Therefore, a preprocessing pipeline is employed for the filtration of noisy text. Afterwards, the cleaned vocabulary is utilized for training Sindhi word embeddings with state-of-the-art GloVe, Skip-Gram (SG), and Continuous Bag of Words (CBoW) word2vec algorithms. The intrinsic evaluation approach of cosine similarity matrix and WordSim-353 are employed for the evaluation of generated Sindhi word embeddings. Moreover, we compare the proposed word embeddings with recently revealed Sindhi fastText (SdfastText) word representations. Our intrinsic evaluation results demonstrate the high quality of our generated Sindhi word embeddings using SG, CBoW, and GloVe as compare to SdfastText word representations.
研究の動機と目的
- シンディ語は豊富な屈折的構造と複数の script を有する低リソース言語であり、大規模で高品質なラベルなしコーパスが不足しているという問題に対処する。
- オープンソースのシンディ語NLPツールが不足している中で、ウェブソースのテキストに起因するノイズを除去するための体系的な前処理パイプラインを構築する。
- 新しく構築されたシンディ語コーパス上で、最先端の単語埋め込みモデル(Skip-gram、CBOW、GloVe)を学習・評価し、より優れた意味的表現を実現する。
- 初めてとして、シンディ語に翻訳されたコサイン類似度とWordSim-353を用いた、シンディ語単語埋め込みの内在的評価ベンチマークを提供する。
- POSタギング、NER、BERTに類似したモデルによる文脈的埋め込みなど、将来的なシンディ語NLPタスクの基盤を構築する。
提案手法
- 限られた公開コーパスの問題を克服するため、ウェブスクリーピングフレームワークを用いて複数のウェブソースから6100万語のシンディ語コーパスを収集した。
- ウェブソースのデータからノイズ、非シンディ語、不正な形式のテキストをフィルタリングするためのカスタム前処理パイプラインを設計・適用し、コーパスの品質を確保した。
- 前処理済みコーパス上で、3つの最先端モデル(Skip-gram(SG)、連続的Bag of Words(CBOW)、GloVe)を用いて単語埋め込みを学習した。
- 意味的類似性の性能を評価するために、コサイン類似度行列とシンディ語に翻訳されたWordSim-353データセットを用いた内在的評価を実施した。
- 公平な比較を保証するため、同じ評価プロトコルを用いて生成された埋め込みと最近リリースされたSdfastTextモデルを比較した。
- 窓サイズ、学習率、エポック数といったハイパーパrameterを最適化し、埋め込み品質を最大化した。特にコーパスサイズと前処理の重要性を強調した。
実験結果
リサーチクエスチョン
- RQ1大規模でウェブソースからの抽出であり、注意深く前処理が施されたシンディ語コーパスは、既存の低リソースベースラインを上回る高品質な単語埋め込みを生成できるか?
- RQ2Skip-gram、CBOW、GloVeモデルは、SdfastTextと比較してシンディ語における意味的・構文的関係をどの程度適切に捉えられるか?
- RQ3SGおよびCBOWにおける文字レベル学習とサブサンプリングは、低リソース環境下でGloVeに比べて意味的表現をどの程度向上させるか?
- RQ4コーパスのサイズと前処理の徹底は、シンディ語における単語埋め込みの内在的評価性能に顕著な影響を及ぼすか?
- RQ5提案された埋め込みは、テキスト分類やWordNet構築といった下流NLPタスクの強力なベースラインとして機能できるか?
主な発見
- 提案されたコーパスには6100万語以上のトークンと908,456語の固有語彙が含まれており、SdfastTextの学習コーパスよりも顕著に大きい。
- Skip-gramモデルが、最近接単語、語のペア類似性、WordSim-353のすべての内在的評価指標で最高の性能を示した。
- CBOW埋め込みはSkip-gramに近く、強い意味的捉えを示したが、GloVeはその性能が低く、文字レベル学習とサブサンプリングの欠如が要因と考えられる。
- SdfastTextがサブワード情報を利用しているにもかかわらず、提案された埋め込みはすべての評価マトリクスでそれを上回った。これは、コーパスサイズと前処理の影響が顕著であることを示している。
- ハイパーパrameterチューニング、特に窓サイズ、学習率、エポック数が埋め込み品質に顕著な影響を及ぼし、最適な設定が性能向上に寄与した。
- コーパスと埋め込みは公開されており、POSタギング、NER、文脈的埋め込みの研究を促進するためのシンディ語ストップワードリストも併記されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。