Skip to main content
QUICK REVIEW

[論文レビュー] English-Twi Parallel Corpus for Machine Translation

Paul Azunre, Salomey Osei|arXiv (Cornell University)|Mar 29, 2021
Natural Language Processing Techniques参考文献 17被引用数 5
ひとこと要約

この論文は、機械翻訳モデルの訓練および評価を目的として、25,421文の英語=トゥイ並列コーパスを提示する。変換器ベースのモデルを用いて初期翻訳を生成し、その後ネイティブ話者による検証を経て翻訳的表現(translationese)を排除する。このデータセットによりニューラルMTモデルのファインチューニングが可能となり、高品質な697文の評価セットも含む。これにより、アクアペム・トゥイという低リソース言語の自然言語処理が著しく進展する。

ABSTRACT

We present a parallel machine translation training corpus for English and Akuapem Twi of 25,421 sentence pairs. We used a transformer-based translator to generate initial translations in Akuapem Twi, which were later verified and corrected where necessary by native speakers to eliminate any occurrence of translationese. In addition, 697 higher quality crowd-sourced sentences are provided for use as an evaluation set for downstream Natural Language Processing (NLP) tasks. The typical use case for the larger human-verified dataset is for further training of machine translation models in Akuapem Twi. The higher quality 697 crowd-sourced dataset is recommended as a testing dataset for machine translation of English to Twi and Twi to English models. Furthermore, the Twi part of the crowd-sourced data may also be used for other tasks, such as representation learning, classification, etc. We fine-tune the transformer translation model on the training corpus and report benchmarks on the crowd-sourced test set.

研究の動機と目的

  • ガーナ語、特に低リソース言語であるアクアペム・トゥイの信頼できる機械翻訳システムの不足を解消すること。
  • ニューラル機械翻訳モデルの訓練および評価を支援する高品質で人間が検証済みの並列コーパスを作成すること。
  • トゥイ語における名前付きエンティティ抽出や品詞タグ付けなどの下流NLPタスクを支援すること。
  • オープンでコミュニティ主導のデータ収集を通じて、アクアペム・トゥイのデジタル時代におけるアクセス性および保存性を向上させること。
  • 公開可能な言語的に正確なリソースを提供することで、アフリカNLPの成長を支援すること。

提案手法

  • 初期の英語→トゥイ翻訳を生成するために、変換器ベースのニューラル機械翻訳モデル(OPUS-MT)が使用された。
  • ネイティブのトゥイ話者が機械翻訳の結果を検証・修正し、翻訳的表現を排除し、より自然な表現に改善した。
  • 別途、697件のクラウドソーシングによる文のペアから成る、より高品質なデータセットを、ガーナ各地のネイティブ話者からGoogleフォームを通じて収集した。
  • 訓練コーパスを用いて変換器翻訳モデルをファインチューニングし、クラウドソーシングされたテストセットで性能を評価した。
  • データセットはモデルの訓練および評価を支援するように設計されており、表現学習やその他のNLPタスクへの応用も可能である。
  • プロジェクトは、Microsoft for StartupsおよびAI4Dからの外部支援を活用し、GPUリソースおよび資金を提供された。

実験結果

リサーチクエスチョン

  • RQ1デジタル存在が限られるガーナ語の一つ、アクアペム・トゥイ語に対して、高品質で低リソースの並列コーパスをどのように構築できるか。
  • RQ2機械翻訳の結果に対して人間による後処理を施すことで、アクアペム・トゥイ語における自然さと正確性がどの程度向上するか。
  • RQ3人間が検証済みのコーパスでファインチューニングされた変換器モデルは、ネイティブのトゥイ語翻訳を対象とした専用評価セットで、性能を向上させられるか。
  • RQ4コミュニティが提供するデータは、アフリカ語のNLPリソースの品質および文化的適合性を向上させる役割を果たせるか。
  • RQ5オープンで公開可能なデータセットは、アクアペム・トゥイ語のような低リソースアフリカ語のNLP研究をどの程度加速できるか。

主な発見

  • 最終的な訓練コーパスには、25,421組の英語とアクアペム・トゥイの文ペアが含まれており、ネイティブ話者の検証を経て自然さと正確性が保証された。
  • 評価セットは、ガーナ各地のネイティブ・トゥイ話者からクラウドソーシングされた697組の高品質な文ペアから構成され、MTモデルのテストに適している。
  • 人間が検証済みのコーパスでファインチューニングした変換器モデルは、翻訳の質が向上し、特に直訳的または慣用的でない表現の削減に効果的であった。
  • 例として、初期の機械翻訳は文法的に正しいものの、意味的正確性に欠けることが判明した。例えば「I've gotten better」が「M'ani agye yiye」と誤って翻訳された。
  • 特定の翻訳エラーも同定された。例えば「turn on the gas」が「fa w'ani si gaas no so」と誤って翻訳された。これは、継続的なコーパスの洗練の必要性を示している。
  • 本研究は、低リソース言語における高品質で文化的に適切な翻訳を達成するには、人間が関与するデータキュレーションが不可欠であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。