Skip to main content
QUICK REVIEW

[論文レビュー] An Exploration of Data Augmentation Techniques for Improving English to Tigrinya Translation

Lidia Kidane, Sachin Kumar|arXiv (Cornell University)|Mar 31, 2021
Natural Language Processing Techniques参考文献 22被引用数 5
ひとこと要約

本稿では、アムハラ語——よりリソースが豊富で、語族的に関連する言語——を介して、高品質な合成英語→ティグリニア並列データを生成するピボットベースのバックトランスレーション手法を提案する。ティグリニア語→アムハラ語およびアムハラ語→英語の非教師ありモデルを活用することで、ベースライン比で+7.1 BLEUポイントの向上を達成し、関連言語を経由するピボット手法が、低リソースニューラル機械翻訳設定において顕著な性能向上をもたらすことを示した。

ABSTRACT

It has been shown that the performance of neural machine translation (NMT) drops starkly in low-resource conditions, often requiring large amounts of auxiliary data to achieve competitive results. An effective method of generating auxiliary data is back-translation of target language sentences. In this work, we present a case study of Tigrinya where we investigate several back-translation methods to generate synthetic source sentences. We find that in low-resource conditions, back-translation by pivoting through a higher-resource language related to the target language proves most effective resulting in substantial improvements over baselines.

研究の動機と目的

  • ティグリニア語——並列データが限られる低リソースのセミチック語——における低リソースニューラル機械翻訳の課題に対処すること。
  • 関連言語からの単語語彙データを活用することで、データ拡張のための合成データ品質を向上させられるかを調査すること。
  • 特にアムハラ語を経由するピボット手法を含むバックトランスレーション戦略の有効性を、低リソース英語→ティグリニア語翻訳において評価すること。
  • 並列データが乏しい状況下で、関連言語ペアの非教師ありモデルが教師あり代替手法を上回るかを検証すること。

提案手法

  • 単語語彙データのみを用いた非教師あり機械翻訳技術を用いて、ティグリニア語→アムハラ語モデルを訓練する。
  • より大きな教師あり並列コーパスを用いて、アムハラ語→英語モデルを訓練し、高品質な翻訳を確保する。
  • 2つのモデルを連鎖的に使用する:単語語彙データのティグリニア語文をアムハラ語に翻訳し、さらに英語に翻訳することで、合成された英語-ティグリニア並列文を生成する。
  • 生成された合成データと限られた本物の英語-ティグリニア並列データを組み合わせ、最終的な英語→ティグリニア翻訳モデルを微調整する。
  • 複数のバックトランスレーション戦略を比較する:直接的(ティグリニア語→英語)、間接的(アムハラ語→英語)、およびピボットベースの手法(ティグリニア語→アムハラ語→英語)。
  • BLEUスコアを用いて、教師ありおよび非教師ありのピボットモデルのバリエーションを含む、さまざまなデータ拡張戦略の翻訳品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1アムハラ語——よりリソースが豊富で関連する言語——を経由することで、低リソース英語→ティグリニア語翻訳における合成並列データの品質が向上するか?
  • RQ2ティグリニア語→アムハラ語モデルの非教師あり学習と教師あり学習の両者を比較した場合、下流の翻訳性能にどのような差が生じるか?
  • RQ3単語語彙データを用いているにもかかわらず、なぜ直接的バックトランスレーション(ティグリニア語→英語)は性能が劣るのか?
  • RQ4ティグリニア語とアムハラ語の間で共有される語彙的要素が、ピボットベース手法の成功にどの程度寄与しているか?
  • RQ5ピボットベース手法の失敗モードは何か。特に、数字やドメインの不一致に起因する問題はどのようなものか?

主な発見

  • 非教師ありティグリニア語→アムハラ語モデルと教師ありアムハラ語→英語モデルを用いたBT-Pivot-Unsup手法は、15.52の最高BLEUスコアを達成し、最良のベースライン比で+7.12 BLEUの向上を示した。
  • BT-Pivot-Sup手法は11.54のBLEUスコアを達成し、ティグリニア語→アムハラ語モデルの教師あり学習が、依然として顕著な性能向上をもたらすことを示した。
  • 直接的バックトランスレーション(BT-Direct)は、ベースライン比で+2.3 BLEUポイントの向上を示したが、並列データが乏しいため、合成翻訳の品質が低いために限界に達していた。
  • アムハラ語→英語翻訳を用いた間接的手法は、BLEUスコア6.2を記録し、アムハラ語を経由するピボット手法よりも劣っていることが示された。
  • 名前付きエンティティや前置詞といった共有語彙は、ティグリニア語とアムハラ語の高い語彙的重複のおかげでピボットチェーン内で保持されるため、この手法は特にそれらの分野で優れた性能を発揮した。
  • 失敗事例として、数字がしばしば捏造されたり誤って翻訳されたりする現象が観察された。これは、合成データにノイズが含まれており、本物のデータ(宗教的テキスト)と合成データ(政府発表)のドメインの不一致が原因である可能性が高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。