Skip to main content
QUICK REVIEW

[論文レビュー] Neural Machine Translation for Low-Resourced Indian Languages

Himanshu Choudhary, Shivansh Rao|arXiv (Cornell University)|Apr 19, 2020
Natural Language Processing Techniques参考文献 23被引用数 6
ひとこと要約

本論文は、多頭部自己注意機構、事前学習済みバイトペア符号化(BPE)およびMultiBPE埋め込みを用いて、語彙外語(OOV)問題と語彙的複雑さに対処する、低リソースなインド諸言語(英語-タミル語、英語-マラヤーラム語)向けの新しいニューラル機械翻訳(NMT)モデルを提案する。モデルは英語-マラヤーラム語で25.36 BLEU、英語-タミル語で9.67 BLEUを達成し、それぞれグーグル翻訳(9.40および5.71 BLEU)を大きく上回り、語彙的に豊富で低リソースな言語対において優れた性能と頑健性を示した。

ABSTRACT

A large number of significant assets are available online in English, which is frequently translated into native languages to ease the information sharing among local people who are not much familiar with English. However, manual translation is a very tedious, costly, and time-taking process. To this end, machine translation is an effective approach to convert text to a different language without any human involvement. Neural machine translation (NMT) is one of the most proficient translation techniques amongst all existing machine translation systems. In this paper, we have applied NMT on two of the most morphological rich Indian languages, i.e. English-Tamil and English-Malayalam. We proposed a novel NMT model using Multihead self-attention along with pre-trained Byte-Pair-Encoded (BPE) and MultiBPE embeddings to develop an efficient translation system that overcomes the OOV (Out Of Vocabulary) problem for low resourced morphological rich Indian languages which do not have much translation available online. We also collected corpus from different sources, addressed the issues with these publicly available data and refined them for further uses. We used the BLEU score for evaluating our system performance. Experimental results and survey confirmed that our proposed translator (24.34 and 9.78 BLEU score) outperforms Google translator (9.40 and 5.94 BLEU score) respectively.

研究の動機と目的

  • 英語-タミル語や英語-マラヤーラム語のような語彙的に豊富で低リソースなインド諸言語におけるニューラル機械翻訳の課題に対処すること。
  • 事前学習済みBPEおよびMultiBPE埋め込みを用いたサブワードトークン化により、語彙的に複雑な言語で一般的な語彙外語(OOV)問題を克服すること。
  • 軽量なNMTアーキテクチャに多頭部自己注意機構を統合することで翻訳品質を向上させること。
  • 英語-タミル語、英語-マラヤーラム語、英語-テルグ語、英語-ベンガル語、英語-ウルドゥ語の並列コーパスを清掃し、公開可能な形で提供すること。
  • グーグル翻訳およびネイティブスピーカーによる評価を通じて、実用性と性能向上を実証すること。

提案手法

  • 著者らは、長距離依存関係を捉え、翻訳品質を向上させるために、多頭部自己注意機構を備えたトランスフォーマー基盤のNMTアーキテクチャを採用した。
  • 両言語のソースおよびターゲット言語に多言語対応のfastText埋め込みを用い、OOV率を低減するためにBPEおよびMultiBPEサブワードトークン化を実施した。
  • 最適化にはAdamを使用し、ドロップアウト正則化(0.3)と300次元の基本埋め込み次元を採用した。
  • データ前処理では、50語を超える文のフィルタリング、ノイズの多い翻訳の削除、重複または既に翻訳済みのコンテンツの除去を実施した。
  • 最終的なモデルは、6層エンコーダーおよびデコーダー、8ヘッドの多頭部注目機構、100,000語彙のMultiBPE埋め込みを備え、最適なパフォーマンスを達成した。
  • 評価にはBLEUスコアとネイティブタミル語話者による人間評価を用い、スムーズさと正確性を検証した。

実験結果

リサーチクエスチョン

  • RQ1多頭部自己注意機構と事前学習済みMultiBPE埋め込みを組み合わせることで、タミル語やマラヤーラム語のような低リソースインド諸言語におけるOOV問題を顕著に軽減できるか?
  • RQ2標準的な語彙レベルの埋め込みと比較して、BPEおよびMultiBPE埋め込みの統合は、語彙的に豊富な言語における翻訳パフォーマンスをどのように向上させるか?
  • RQ3提案されたNMTモデルは、英語-インド諸言語対においてグーグル翻訳のような商用システムをどの程度上回るか?
  • RQ4データ前処理は、低リソース言語翻訳のための並列コーパスの品質と信頼性を向上させる上で果たす役割は何か?
  • RQ5効率的なサブワードトークン化を備えた比較的軽量なNMTモデルは、複雑でリソースを大量に要するアーキテクチャと同等またはそれ以上のパフォーマンスを達成できるか?

主な発見

  • 提案されたNMTモデルは、英語-マラヤーラム語翻訳タスクで25.36 BLEUを達成し、グーグル翻訳の9.40 BLEUを大きく上回った。
  • 英語-タミル語タスクでは、9.67 BLEUを達成し、グーグル翻訳の5.71 BLEUを上回った。これは3.96ポイントの改善を示している。
  • MultiBPE埋め込みの使用によりOOV問題が軽減され、特にタミル語やマラヤーラム語の希少語や複雑な語彙的形態において一般化性能が向上した。
  • 人間評価では、ネイティブタミル語話者の60%がモデルの翻訳をグーグル翻訳よりも好んだ。
  • 多頭部注目機構とMultiBPE埋め込みを備えた最終モデルが最高のパフォーマンスを達成し、注目機構とサブワードレベルの事前学習済み埋め込みを組み合わせることの有効性を示した。
  • 著者らは、英語-タミル語、英語-マラヤーラム語、およびその他のインド諸言語対を含む10万対以上の文のペアを含む、清掃済みで公開可能な並列コーパスをリリースした。今後の研究を支援するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。