Skip to main content
QUICK REVIEW

[論文レビュー] Marathi To English Neural Machine Translation With Near Perfect Corpus And Transformers

Swapnil Ashok Jadhav|arXiv (Cornell University)|Feb 26, 2020
Natural Language Processing Techniques参考文献 18被引用数 10
ひとこと要約

この論文は、Transformerアーキテクチャとほぼ完璧な並列コーパスを用いたマラーティー語から英語へのニューラル機械翻訳システムを提示する。FacebookのFairseqを用いてトレーニングされ、Hugging FaceのBERTトークナイザーが使用されている。TatoebaおよびWikimediaデータセットにおいて、Googleを上回るBLEUスコアを達成しており、限られたトレーニングデータにもかかわらず、低リソースなインド語の翻訳分野で最先端のパフォーマンスを示している。

ABSTRACT

There have been very few attempts to benchmark performances of state-of-the-art algorithms for Neural Machine Translation task on Indian Languages. Google, Bing, Facebook and Yandex are some of the very few companies which have built translation systems for few of the Indian Languages. Among them, translation results from Google are supposed to be better, based on general inspection. Bing-Translator do not even support Marathi language which has around 95 million speakers and ranks 15th in the world in terms of combined primary and secondary speakers. In this exercise, we trained and compared variety of Neural Machine Marathi to English Translators trained with BERT-tokenizer by huggingface and various Transformer based architectures using Facebook's Fairseq platform with limited but almost correct parallel corpus to achieve better BLEU scores than Google on Tatoeba and Wikimedia open datasets.

研究の動機と目的

  • 低リソースなインド語向けに、高精度なマラーティー語から英語へのニューラル機械翻訳システムを開発すること。
  • 限られたが高精度な並列コーパスを用いて、最先端のTransformerベースのアーキテクチャをマラーティー語に適用する。
  • 公開されたベンチマークデータセットを用いて、Google Translateのような商用システムと比較する。
  • ほぼ完璧な並列コーパスが、限られたデータでも翻訳品質を著しく向上させることを示すこと。
  • マラーティー語(約9500万人の話者)は商業的サポートが限られているが、再現可能でオープンソースのNMTシステムを貢献すること。

提案手法

  • FacebookのFairseqフレームワークを用いて、限られたが高精度な並列コーパス上で複数のTransformerベースのアーキテクチャをトレーニングする。
  • 入力シーケンスのトークナイゼーションにHugging FaceのBERTトークナイザーを用い、サブワード表現と未知語処理を改善する。
  • ハイパーパramータチューニングとエアリー・ストッピングを用いたモデル最適化により、小さなデータセットでの過学習を防ぐ。
  • TatoebaおよびWikimediaの公開テストセットを用いたBLEUスコアによるモデルパフォーマンスの評価。
  • ノイズを最小限に抑え、低リソース環境でのアライメント品質を向上させるために、キュレートされたほぼ完璧な並列コーパスの使用。
  • さまざまなTransformerバリアントの比較により、マラーティー語から英語への翻訳で最も優れたパフォーマンスを示すアーキテクチャを同定する。

実験結果

リサーチクエスチョン

  • RQ1限られたサイズにもかかわらず、ほぼ完璧な並列コーパスがマラーティー語から英語へのNMTパフォーマンスを著しく向上させることができるか?
  • RQ2Transformerベースのアーキテクチャが、低リソースなマラーティー語から英語への翻訳において、他のニューラルアーキテクチャを上回ることができるか?
  • RQ3カスタムトレーニングされたモデルが、オープンベンチマークデータセットにおいてGoogle Translateのような商用システムを上回ることができるか?
  • RQ4BERTトークナイゼーションが、低リソース環境での翻訳品質にどのような影響を与えるか?
  • RQ5最小限の並列データを用いたマラーティー語から英語への翻訳に最適なTransformerアーキテクチャは何か?

主な発見

  • 提案されたモデルは、TatoebaおよびWikimediaのオープンデータセットにおいて、Google翻訳を上回るBLEUスコアを達成した。
  • ほぼ完璧な並列コーパスの使用により、トレーニングデータのサイズが限られても顕著なパフォーマンス向上が達成された。
  • Fairseqで微調整されたTransformerベースのアーキテクチャとBERTトークナイゼーションを組み合わせたモデルが、評価において他のニューラルアーキテクチャを上回った。
  • 高品質でキュレートされた並列データが、低リソースな言語対におけるデータ不足を補うことができることを示した。
  • モデルのパフォーマンスは、既存の商用システムを上回っており、低リソースNLPアプリケーションにおける強力な可能性を示している。
  • 結果は、キュレートされたデータと現代のTransformerアーキテクチャを組み合わせることで、インド語翻訳分野において効果的であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。