Skip to main content
QUICK REVIEW

[論文レビュー] Low-Resource Language Modelling of South African Languages

Stuart Mesham, Luc Hayward|arXiv (Cornell University)|Apr 1, 2021
Topic Modeling参考文献 33被引用数 10
ひとこと要約

この論文は、低リソースな南アフリカ諸言語、特にisiZuluおよびSepediを対象として、バイトペア符号化(BPE)を用いたオープンボキャブラリー言語モデルの評価を行う。小規模なデータセットにおいて、正則化が適切に施されたRNN(AWD-LSTMおよびQRNN)がn-gram、フィードフォワード、Transformerモデルを上回り、関連するNguniおよびSotho-Tswana諸言語の間でマルチリンガル学習を実施することで、性能がさらに向上する。

ABSTRACT

Language models are the foundation of current neural network-based models for natural language understanding and generation. However, research on the intrinsic performance of language models on African languages has been extremely limited, which is made more challenging by the lack of large or standardised training and evaluation sets that exist for English and other high-resource languages. In this paper, we evaluate the performance of open-vocabulary language models on low-resource South African languages, using byte-pair encoding to handle the rich morphology of these languages. We evaluate different variants of n-gram models, feedforward neural networks, recurrent neural networks (RNNs), and Transformers on small-scale datasets. Overall, well-regularized RNNs give the best performance across two isiZulu and one Sepedi datasets. Multilingual training further improves performance on these datasets. We hope that this research will open new avenues for research into multilingual and low-resource language modelling for African languages.

研究の動機と目的

  • アフリカ諸言語、特に低リソースな南アフリカ諸言語における内在的言語モデル性能に関する研究の不足を解決すること。
  • agglutinativeなベヌー=コンゴ諸語(isiZuluおよびSepediを含む)におけるデータスパarsityおよび語彙的複雑性の課題を克服すること。
  • n-gram、フィードフォワード、RNN、Transformerといったさまざまなニューラルアーキテクチャが、小規模で低リソースなデータセット上でどのように機能するかを評価すること。
  • 関連する南アフリカ諸言語を用いたマルチリンガル学習が、アーキテクチャの変更なしに言語モデル性能を向上させるかどうかを調査すること。
  • バイトペア符号化(BPE)が、形態的豊かさとオープンボキャブラリーのモデリングを低リソース環境で効果的に扱うのにどのように有用であるかを示すこと。

提案手法

  • 語彙サイズを調整可能なバイトペア符号化(BPE)を用いて、語をサブワードユニットにトークン化し、語彙スパarsityを低減する(例:isiZuluでは8000、Sepediでは2000)。
  • n-gramモデル、フィードフォワードニューラルネットワーク(FFNN)、再帰的ニューラルネットワーク(LSTM、AWD-LSTM、QRNN)、およびTransformerの複数の言語モデルアーキテクチャを訓練および評価する。
  • モデルパフォーマンスの比較に使用する主な評価指標として、文字あたりのビット数(BPC)を採用する。
  • 特にAWD-LSTMおよびQRNNモデルの過学習を防ぐために、ドロップアウトや重み減衰といった正則化技術を実装する。
  • 複数の関連する南アフリカ諸言語(例:NguniおよびSotho-Tswanaグループ)のテキストを1つのトレーニングセットに連結することで、マルチリンガル学習を実施する。
  • 単語彙的、同じ言語グループ内、異言語グループ間、および完全なマルチリンガル設定の4つの設定で、それぞれ別々のモデルを訓練し、各構成ごとにハイパーパrameterを最適化する。

実験結果

リサーチクエスチョン

  • RQ1n-gram、FFNN、RNN、Transformerといった異なるニューラル言語モデルアーキテクチャは、isiZuluおよびSepediのような低リソースな南アフリカ諸言語でどの程度のパフォーマンスを示すか?
  • RQ2正則化が適切に施されたRNN(AWD-LSTMおよびQRNN)は、アグリューティブな言語において、Transformerや単純なモデルを上回る性能を示せるか?
  • RQ3関連する南アフリカ諸言語を用いたマルチリンガル学習は、アーキテクチャの変更なしに言語モデル性能を向上させるか?
  • RQ4BPEに基づくサブワードトークン化は、ベヌー=コンゴ諸語における形態的豊かさと大きな語彙レベルのボキャブラリーの課題をどの程度軽減できるか?
  • RQ5同じ言語グループに属する言語で学習するのと、異なるが関連する言語グループの言語で学習するのとで、パフォーマンスに差が生じるか?

主な発見

  • 正則化が適切に施されたRNN(AWD-LSTMおよびQRNN)が、すべての3つのデータセット(isiZuluおよびSepedi)で最良のパフォーマンスを示し、Transformerおよび単純なモデルを上回った。
  • AWD-LSTMおよびQRNNモデルは、Sepediデータセットでそれぞれ1.331および1.334のテストBPCスコアを達成し、isiZuluデータセットでそれぞれ1.298および1.391を記録した。
  • マルチリンガル学習は顕著な性能向上をもたらした。全9種の非ヨーロッパ圏南アフリカ諸言語を用いて学習した最良のモデルは、isiZuluでBPC 1.298、SepediでBPC 1.331を達成した。
  • 同じ言語グループ(例:isiZuluのための全Nguni言語)で学習すると強い向上が得られ、特にSotho-TswanaグループはNguniグループよりもSepediの向上に寄与した。
  • n-gramおよびFFNNモデルは性能が低く、一貫性に欠け、トレーニング速度とパフォーマンスのトレードオフが顕著で、n-gramは高速だが正確性に欠ける傾向にあった。
  • BPEは形態的複雑性の管理に効果的であり、オープンボキャブラリーのモデリングを可能にし、低リソース環境におけるデータスパarsityを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。