Skip to main content
QUICK REVIEW

[論文レビュー] Lite Training Strategies for Portuguese-English and English-Portuguese Translation

Alexandre Lopes, Rodrigo Nogueira|arXiv (Cornell University)|Aug 20, 2020
Topic Modeling参考文献 19被引用数 4
ひとこと要約

本稿では、1枚の8GBゲーミングGPUを用いて、ポルトガル語-英語および英語-ポルトガル語のニューラル機械翻訳のための軽量なトレーニング戦略を提案する。英語またはポルトガル語のコーパスで事前学習された微調整済みT5モデルを活用し、ポルトガル語の diacritics を処理するためのトークナイザードアプテーションを導入。最小限のハードウェアとオープンソースのモデルおよびデータを用いて、en-pt では Google Translate と同等のパフォーマンスを達成し、WMT19バイオメディカルタスクでは最先端のシステムを上回る性能を発揮。

ABSTRACT

Despite the widespread adoption of deep learning for machine translation, it is still expensive to develop high-quality translation models. In this work, we investigate the use of pre-trained models, such as T5 for Portuguese-English and English-Portuguese translation tasks using low-cost hardware. We explore the use of Portuguese and English pre-trained language models and propose an adaptation of the English tokenizer to represent Portuguese characters, such as diaeresis, acute and grave accents. We compare our models to the Google Translate API and MarianMT on a subset of the ParaCrawl dataset, as well as to the winning submission to the WMT19 Biomedical Translation Shared Task. We also describe our submission to the WMT20 Biomedical Translation Shared Task. Our results show that our models have a competitive performance to state-of-the-art models while being trained on modest hardware (a single 8GB gaming GPU for nine days). Our data, models and code are available at https://github.com/unicamp-dl/Lite-T5-Translation.

研究の動機と目的

  • 低コストで消費者向けのハードウェアを用いて、ポルトガル語-英語および英語-ポルトガル語の高品質なニューラル機械翻訳システムを開発すること。
  • 英語のみのコーパスで事前学習されたモデルがポルトガル語固有の文字(例:アクセント、〜記号)を処理する課題に対処すること。
  • 平行コーパスで微調整されたT5ベースモデルの性能を、英語で事前学習したモデルとポルトガル語で事前学習したモデルと比較して評価すること。
  • 研究者や小規模ラボが利用可能な、効率的で再現可能な翻訳システムを提供すること。
  • 標準的なデータセット上で、Google Translate や最先端のモデルと比較して性能をベンチマークすること。

提案手法

  • 英語またはポルトガル語の単語コーパスで事前学習されたT5-baseモデルを、シーケンス・ツー・シーケンス翻訳用に微調整する。
  • 元の英語用トークナイザを、ポルトガル語固有の文字(例:ã, ç, á)を処理できるように、事前処理および事後処理戦略を用いて変更する。
  • T5のテキスト・ツー・テキストフレームワークを活用し、翻訳タスクをテキスト生成問題に再定式化する。
  • 9日間、32GB RAMの1枚のNVIDIA RTX 2070 GPU(8GB)を用い、ParaCrawlおよびWMTデータセットでモデルを学習する。
  • 長文翻訳タスクのパフォーマンス向上を図るため、シーケンス長調整(TSLおよびSSL)を適用する。
  • SacreBLEUを用いて、ParaCrawl 99kテストセットおよび公式のWMTテストセットでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1ポルトガル語で事前学習したT5モデルは、英語で事前学習したモデルよりも、ポルトガル語-英語および英語-ポルトガル語翻訳で優れた翻訳品質を達成できるか?
  • RQ2再トレーニングを必要とせずに、英語用トークナイザをポルトガル語の diacritics を処理できるように適応させることは、翻訳パフォーマンスを顕著に向上させるか?
  • RQ31枚のコンsumer-grade GPU(8GB)で、複数枚のハイエンドGPUを用いてトレーニングされたシステムと比較して、競争力のある翻訳モデルを生成できるか?
  • RQ4標準的なベンチマークデータセット上で、本システムの性能は Google Translate や他のSOTAモデルと比較してどの程度か?
  • RQ5ソースおよびターゲットのシーケンス長を延長することで、長文バイオメディカルテキストの翻訳品質はどの程度向上するか?

主な発見

  • ポルトガル語で事前学習したT5モデルは、WMT19バイオメディカルpt-enタスクで46.51 BLEUを達成し、英語で事前学習したモデル(45.89)を上回り、en-pt では優勝提出物(45.62 vs. 48.18)と同等の性能を発揮した。
  • ParaCrawl 99kテストセットでは、ポルトガル語で事前学習したモデルがpt-enで46.35 BLEU、en-ptで45.44 BLEUを達成。en-pt ではGoogle Translate(51.20および45.17)と同等の性能を発揮し、pt-en ではそれを上回った。
  • ターゲットおよびソースのシーケンス長を延長(TSL=256, SSL=256)したことで、en-ptのBLEUスコアは49.06に上昇し、ベースモデル比で+9.75の向上を達成した。
  • トークナイザードアプテーションにより、再トレーニングを要せずして翻訳品質が顕著に向上し、英語で事前学習したモデルをポルトガル語テキストに効果的に活用できるようになった。
  • 1枚の8GB GPUのみを用いてWMT19で最先端のパフォーマンスを達成した。一方、優勝したWMT19システムは4台のV100を用いていた。
  • WMT20では、pt-enタスクで優勝チームより2.17 BLEUポイント低いが、ベースラインより4.48ポイント高いスコアを記録し、ポルトガル語で事前学習したモデルの強力なポentialを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。