Skip to main content
QUICK REVIEW

[論文レビュー] Adaptation of Machine Translation Models with Back-translated Data using Transductive Data Selection Methods

Alberto Poncelas, Gideon Maillette de Buy Wenniger|arXiv (Cornell University)|Jun 18, 2019
Natural Language Processing Techniques被引用数 6
ひとこと要約

本稿では、一般ドメインの神経機械翻訳(NMT)モデルを特定ドメインに適応させるために、逆翻訳された合成データに対して従淘汰的データ選択手法—不頻出n-gram回復(INR)および特徴減衰アルゴリズム(FDA)—を適用することを提案する。逆翻訳データにノイズが含まれるにもかかわらず、テストセットとのn-gram被覆度に基づいて合成文を選択することで翻訳性能が向上し、近似されたターゲット側翻訳をシードとして使用するオンライン処理がバッチ処理を上回る性能を示した。

ABSTRACT

Data selection has proven its merit for improving Neural Machine Translation (NMT), when applied to authentic data. But the benefit of using synthetic data in NMT training, produced by the popular back-translation technique, raises the question if data selection could also be useful for synthetic data? In this work we use Infrequent N-gram Recovery (INR) and Feature Decay Algorithms (FDA), two transductive data selection methods to obtain subsets of sentences from synthetic data. These methods ensure that selected sentences share n-grams with the test set so the NMT model can be adapted to translate it. Performing data selection on back-translated data creates new challenges as the source-side may contain noise originated by the model used in the back-translation. Hence, finding n-grams present in the test set become more difficult. Despite that, in our work we show that adapting a model with a selection of synthetic data is an useful approach.

研究の動機と目的

  • 従淘汰的データ選択(TDS)手法が、合成された逆翻訳データを用いてNMTモデルの適応を改善できるかどうかを調査すること。
  • 処理の効率性と有効性に注目し、TDSを合成データに適用する際のバッチ処理とオンライン処理の戦略を比較すること。
  • 元のソース側テストセットが利用できない状況で、テストセットの近似されたターゲット側翻訳をシードとして用いることで、データ選択の質が向上するかどうかを評価すること。
  • 逆翻訳データに含まれるノイズがn-gram回復および選択性能に与える影響を分析すること。
  • TDSにより選択された合成データが、NMT適応タスクにおいて実際のドメイン内データを上回るか、あるいは補完的に機能するかどうかを特定すること。

提案手法

  • テストセットに存在するレアなn-gramに基づいてスコアを算出し、すでに選択済みの文をペナルティとして与えることで、不頻出n-gram回復(INR)を用いて合成文を選択する。
  • テストセットとのn-gram被覆度を奨励しつつ、頻繁に選択されたn-gramのスコアを徐々に減衰させる特徴減衰アルゴリズム(FDA)を用いて文をスコア化する。
  • バッチ処理(事前に全単語集合を逆翻訳し、その後選択)とオンライン処理(まず単語集合の文を選び、その後逆翻訳)の2つの処理モードを実装する。
  • 一般ドメインNMTモデルを用いてテストセットの近似されたターゲット側翻訳を生成し、ソース側が利用できない状況でTDSのシードとして用いる。
  • TDSで選択された合成データで微調整した後のモデル性能を、ホールドアウトテストセットにおけるBLEUスコアで評価する。
  • ソース側と近似ターゲット側の両方のシードからのターゲットアセンブリ(TA)出力を組み合わせることで、カバレッジと関連性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1INR や FDA のような従淘汰的データ選択手法が、合成的かつ逆翻訳されたデータに効果的に適用可能かどうか。
  • RQ2単語集合の文を逆翻訳する前に選択するオンライン処理が、完全に逆翻訳されたデータを対象とするバッチ処理よりも優れた結果をもたらすかどうか。
  • RQ3実際のソース側テストセットを直接使用するのと比較して、テストセットの近似ターゲット側翻訳をシードとして用いることで、データ選択の質と下流の翻訳性能にどのような差が生じるか。
  • RQ4逆翻訳データのノイズが、TDS手法による関連n-gramの回復能力およびモデル適応性能に及ぼす影響の程度はどの程度か。
  • RQ5TDSにより選択された合成データが、ドメイン適応タスクにおいて実際のドメイン内データを上回るか、あるいは補完的に機能するかどうか。

主な発見

  • 単語集合の文を最初に選択し、その後逆翻訳するオンライン処理は、BLEUスコアの向上においてバッチ処理を常に上回った。
  • 翻訳エラーの可能性があるにもかかわらず、テストセットの近似ターゲット側翻訳をTDSのシードとして用いることで、直接ソース側テストセットを使用するよりも高い性能が得られた。
  • 近似ターゲット側シードを用いたFDAアルゴリズム($FDA_{trg}$)は、$FDA_{src}$ よりも参照文に近い翻訳を生成し、特に「rehearsal room」のような文脈的に重要な用語の保持に優れていた。
  • 逆翻訳文に不自然なn-gram(例:'bounmit' が 'Hüpfburg' の代わりに)が含まれても、部分的なn-gram被覆度によりTDS手法は依然として関連する文を特定できた。
  • 本研究では、人工的でノイズを含む可能性のあるデータであっても、TDSにより選択された合成データがモデル性能を向上させられることを示し、このアプローチの頑健性を実証した。
  • 両方の$TA_{src}$ と $TA_{trg}$ の出力を組み合わせることでカバレッジが向上し、全体的な適応結果が改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。