Skip to main content
QUICK REVIEW

[論文レビュー] Improving Yorùbá Diacritic Restoration

Iroro Orife, David Ifeoluwa Adelani|arXiv (Cornell University)|Mar 23, 2020
Agriculture and Rural Development Research被引用数 5
ひとこと要約

この論文は、聖書以外の多様なソース——光学式文字認識(OCR)処理済みの小説、ニュース、会話文テキスト——を用いてトレーニングデータを拡張することで、ヨルゥバ語の発音記号復元(ADR)を改善した。変換器モデルにFastText埋め込みを適用した結果、59.80のBLEUスコアを達成し、従来のモデルを著しく上回った。この手法により、日常的・会話的・コードスイッチドな言語処理における一般化性能が向上し、ヨルゥバ語の実世界における自然言語処理応用にとって重要である。

ABSTRACT

Yorùbá is a widely spoken West African language with a writing system rich in orthographic and tonal diacritics. They provide morphological information, are crucial for lexical disambiguation, pronunciation and are vital for any computational Speech or Natural Language Processing tasks. However diacritic marks are commonly excluded from electronic texts due to limited device and application support as well as general education on proper usage. We report on recent efforts at dataset cultivation. By aggregating and improving disparate texts from the web and various personal libraries, we were able to significantly grow our clean Yorùbá dataset from a majority Bibilical text corpora with three sources to millions of tokens from over a dozen sources. We evaluate updated diacritic restoration models on a new, general purpose, public-domain Yorùbá evaluation dataset of modern journalistic news text, selected to be multi-purpose and reflecting contemporary usage. All pre-trained models, datasets and source-code have been released as an open-source project to advance efforts on Yorùbá language technology.

研究の動機と目的

  • 既存のADRモデルが口語的・会話的・コードスイッチドなヨルゥバ語テキストに対して一般化性能に欠ける問題に対処すること。
  • 多様な言語的ドメインにわたるモデル性能の向上により、非発音記号付きヨルゥバ語テキストの曖昧さを低減すること。
  • 高精度で実用的な電子テキストを処理できる、オープンソースのADRシステムを構築すること。
  • 限定的な宗教的コーパスにとどまらない、拡張された高品質なトレーニングデータを通じてモデル性能を向上させること。
  • ヨルゥバ語言語技術のユーザーフレンドリーなアプリケーションやデバイスへの実用的導入を可能とすること。

提案手法

  • 公共ドメインのソースから多様なヨルゥバ語テキストを収集・整備した。これにはニュース(Global Voices)、小説(Háà Ènìyàn)、ことわざ、人権宣言が含まれる。
  • 商業用OCRソフトウェアを用いてスキャン済み書籍を処理し、英語、ルーマニア語、ベトナム語の文字を含めることでヨルゥバ文字セットを近似的に再現した。
  • 人間が関与する補正パイプラインを実装し、1名の専門家が2週間をかけて小説テキスト20,038語を補正した。
  • AWS p3.2xlargeインスタンスを用いてOpenNMT-pyでソフトアテンションseq2seqおよび変換器ベースのモデルをトレーニングした。
  • FastText語彙埋め込みを導入し、ADR性能に与える影響を評価した。
  • Global Voicesから新たに作成した現代的で実用的なテストセットを用い、BLEU、パープレキシティ、語誤り率(WER)でモデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1宗教的コーパスにとどまらないトレーニングデータの拡張は、口語的・会話的ヨルゥバ語テキストにおけるADRモデルの一般化性能をどの程度向上させるか?
  • RQ2事前学習済みFastText埋め込みは、異なるモデルアーキテクチャにおいてADR性能をどの程度向上させるか?
  • RQ3レア語彙・数字を含む語・コードスイッチド入力語に対してADRモデルはどの程度の耐性を示すか?
  • RQ4変換器ベースアーキテクチャは、ソフトアテンションseq2seqモデルに比べてヨルゥバ語ADRでどの程度の性能向上をもたらすか?
  • RQ5ジャーナリズムテキストに基づいた新しい現代的評価データセットは、既存の文学的コーパスに比べて、実世界のADR課題をよりよく反映できるか?

主な発見

  • 最も優れた性能を示したモデルは、すべての新規トレーニングデータとFastText埋め込みを用いた変換器モデルで、Global Voicesテストセットにおいて59.80のBLEUスコアを達成した。
  • JW300を除くすべての新規データソースを追加することで、BLEUは26.53から43.39に上昇し、相対的に64.4%の向上を達成した。
  • JW300の導入により、ベースライン比で相対的に33%のBLEUスコア上昇と、絶対的に11%のWER低下が達成された。
  • 全データとFastText埋め込みを用いた変換器モデルは、WERが22.42%に低下し、ベースラインの58.17%から相対的に61.4%の削減を達成した。
  • 未知語彙やコードスイッチド入力に対して、モデルは劣化を穏やかに示し、まれなトークンに誤りがあっても、その後の単語に対して正しく発音記号を予測する傾向を示した。
  • FastText埋め込みは変換器モデルにおいてわずかだが一貫した性能向上をもたらしたが、ソフトアテンションモデルではメトリクスによって結果が不一致であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。