[論文レビュー] Synthetic Data for Neural Machine Translation of Spoken-Dialects
本稿では、語彙埋め込みの投影と小さなシード並列コーパスを用いて、話される方言のニューラル機械翻訳(NMT)のための合成並列データを生成する、言語に依存しない手法を提案する。リソース豊富な言語(例:現代標準アラビア語)の語を、モノリンガル埋め込みと近似最近傍探索を介して低リソース方言(例:レバノン・アラビア語)に投影することで、Levantine-to-English翻訳において2.8 BLEUポイントの向上を達成し、方言用の並列学習データが存在しない状況でも高品質な翻訳を可能にする。
In this paper, we introduce a novel approach to generate synthetic data for training Neural Machine Translation systems. The proposed approach transforms a given parallel corpus between a written language and a target language to a parallel corpus between a spoken dialect variant and the target language. Our approach is language independent and can be used to generate data for any variant of the source language such as slang or spoken dialect or even for a different language that is closely related to the source language. The proposed approach is based on local embedding projection of distributed representations which utilizes monolingual embeddings to transform parallel data across language variants. We report experimental results on Levantine to English translation using Neural Machine Translation. We show that the generated data can improve a very large scale system by more than 2.8 Bleu points using synthetic spoken data which shows that it can be used to provide a reliable translation system for a spoken dialect that does not have sufficient parallel data.
研究の動機と目的
- 神経機械翻訳における話される方言の並列学習データの不足に対処すること。
- 並列学習データが存在しない低リソースの話される方言の高品質な翻訳を、小さなシード並列コーパスとモノリンガルデータのみを用いて可能にすること。
- 任意の関連言語変種や方言に対して合成並列データを生成できる、言語に依存しないアプローチの開発。
- 再訓練を一切行わずに、大規模NMTシステムの方言翻訳性能を向上させること。
- 合成データの有効性が、オープンドメインで低リソースの方言翻訳においてNMT性能を向上させることを評価すること。
提案手法
- 出発言語、対象言語、および方言用に事前学習済みのモノリンガル語彙埋め込み(例:word2vec)を活用する。
- 方言と標準語、または対象言語との間の小さなバイリスチック語彙辞書または並列データを用いて、局所化された埋め込み投影を学習する。
- 学習済みの投影を用いて、近似最近傍(ANN)探索を実行し、出発言語の語をその方言語にマッピングする。
- 方言、標準語、対象言語の3方向並列コーパスを構築し、データ拡張およびマルチステップ翻訳パイプラインを可能にする。
- 合成された方言-対象言語並列データを用いて、大規模NMTシステムを訓練または微調整する。学習に追加するか、事前学習済みモデルの継続的学習を行う。
- ゼロショットおよびドメイン内一般化の両方を評価するため、方言-対象言語および標準語-対象言語のテストセットで性能を評価する。
実験結果
リサーチクエスチョン
- RQ1語彙埋め込みの投影を用いて生成された合成並列データが、低リソースの話される方言のNMT性能を顕著に向上させることができるか?
- RQ2人間が翻訳したMSAデータを用いたオラクルシステムと比較して、合成データで訓練された大規模NMTシステムの性能はどの程度か?
- RQ3合成データの導入により、標準語テストセットの性能が低下しないか?
- RQ4Levantine Arabicのように並列データが極めて少ない方言に対しても、本手法が効果的に適用可能か?
- RQ5本アプローチは言語に依存せず、他の方言や言語変種へも容易に移植可能か?
主な発見
- 大規模NMTシステムに200万件の合成Levantine-English文を追加した結果、Levantine-EnglishテストセットのBLEUスコアが25.03から27.91に2.8ポイント向上した。
- 合成データで訓練されたシステムは、Levantine-to-EnglishでBLEUスコア27.91を達成し、人間が翻訳したMSA-to-Englishデータを用いたオラクルシステムの28.20に僅か0.3ポイント未満にとどまった。
- 合成データの導入により、標準MSA-to-EnglishのNIST-08テストセットの性能は低下せず、ベースシステムの53.45と比較して53.42を維持した。
- 事前学習済みシステムを合成データで微調整した結果、BLEUスコアは27.37に上昇したが、完全再訓練に比べて改善度は限定的であった。
- 方言と標準語の語彙が58%の重複を持つ状況でも、意味的かつ有用な合成データを効果的に生成でき、誤った語の置換を回避した。
- 本手法により、1つのNMTシステムが書記体と話言語の両方を効果的に処理できるようになり、入力の多様性に対して高い耐性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。