Skip to main content
QUICK REVIEW

[論文レビュー] Morphological Tagging and Lemmatization of Albanian: A Manually Annotated Corpus and Neural Models

Nelda Kote, Marenglen Biba|arXiv (Cornell University)|Dec 2, 2019
Natural Language Processing Techniques参考文献 11被引用数 7
ひとこと要約

本稿では、アルバニア語の手作業による品詞・語彙素的タギングコーパスを初めて公開する。自然言語テキスト約118,000語 token と、67,000件の合成トレーニング文を含む。Turku Neural Parser Pipeline を用いて、神経ネットワークモデルを訓練した結果、品詞タギングで92.74%、語彙素的タギングで85.31%、語彙素還元で89.95%の精度を達成した。アルバニア語の自然言語処理基盤リソースとして、データとモデルの両方を公開している。

ABSTRACT

In this paper, we present the first publicly available part-of-speech and morphologically tagged corpus for the Albanian language, as well as a neural morphological tagger and lemmatizer trained on it. There is currently a lack of available NLP resources for Albanian, and its complex grammar and morphology present challenges to their development. We have created an Albanian part-of-speech corpus based on the Universal Dependencies schema for morphological annotation, containing about 118,000 tokens of naturally occuring text collected from different text sources, with an addition of 67,000 tokens of artificially created simple sentences used only in training. On this corpus, we subsequently train and evaluate segmentation, morphological tagging and lemmatization models, using the Turku Neural Parser Pipeline. On the held-out evaluation set, the model achieves 92.74% accuracy on part-of-speech tagging, 85.31% on morphological tagging, and 89.95% on lemmatization. The manually annotated corpus, as well as the trained models are available under an open license.

研究の動機と目的

  • アルバニア語に限っては、複雑な語形変化と限られたデジタルツールを有する言語として、自然言語処理リソースの不足に対処すること。
  • ユニバーサルデベロップメント仕様に準拠した、高品質で手作業によるアノテーション付きコーパスを、語彙素的タギング用に整列させること。
  • 新たに作成されたコーパスを用いて、アルバニア語の語彙素的タギングおよび語彙素還元のための神経ネットワークモデルを訓練・評価すること。
  • アノテーション付きコーパスと訓練済みモデルをオープンライセンスのもとで一般および学術的利用のために公開すること。

提案手法

  • 著者らは、多様なソースから約118,000語 token の自然なアルバニア語テキストを収集し、トレーニング用に67,000件の人工的に生成された簡単な文を補足した。
  • コーパスは、ユニバーサルデベロップメント基準に従い、品詞および語彙素的特徴について手作業でアノテーションされた。
  • セグメンテーション、語彙素的タギング、語彙素還元のための神経ネットワークモデルは、Turku Neural Parser Pipeline を用いて訓練された。
  • モデルの性能を測定するために、ホールドアウトされたテストセットを用いて評価が行われた。評価項目は品詞タギング、語彙素的タギング、語彙素還元の3つである。
  • モデルのトレーニングと評価は、文脈的埋め込みと条件付きランダムフィールド(CRF)によるデコードを用いた、シーケンス・ツー・シーケンスフレームワークで実施された。

実験結果

リサーチクエスチョン

  • RQ1限られた既存リソースのもとで、神経ネットワークモデルがアルバニア語の語彙素的タギングおよび語彙素還元でどの程度の性能を示すか?
  • RQ2ユニバーサルデベロップメントに準拠した手作業アノテーション付きコーパスは、アルバニア語の自然言語処理モデルのトレーニングにどの程度効果的か?
  • RQ3実際のデータと合成データの組み合わせは、アルバニア語のような低リソース環境において、モデルの汎化性能を向上させることができるか?
  • RQ4提案されたモデルは、品詞タギング、語彙素的タギング、語彙素還元の各タスクで、ベースライン手法をどの程度上回るか?

主な発見

  • 神経ネットワークモデルは、品詞タギングで92.74%の精度を達成し、構文的分類の強力な性能を示した。
  • 語彙素的タギングは85.31%の精度に達し、アルバニア語の豊富な屈曲的語形変化がもたらす課題を反映している。
  • 語彙素還元は89.95%の精度を達成し、語彙素的複雑性が存在する中でも、基本語形の回復が効果的に行われていることを示している。
  • 約118,000語 token の手作業アノテーション付きコーパスと、67,000語 token の合成トレーニングデータは、将来のアルバニア語自然言語処理研究の基盤を強固にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。