[論文レビュー] Contrastive Learning for Many-to-many Multilingual Neural Machine Translation
この論文では、平行文書および単語文書のデータ増強を用いて、対照的損失を用いて多言語間表現の整合性を向上させる、many-to-many 多言語ニューラル機械翻訳のための対照的学習フレームワーク mRASP2 を提案する。英語中心および非英語翻訳方向の両方で最先端の性能を達成し、ゼロショットおよび非教師あり設定においてベースラインと比較して平均で10 BLEU以上の向上を達成する。
Existing multilingual machine translation approaches mainly focus on English-centric directions, while the non-English directions still lag behind. In this work, we aim to build a many-to-many translation system with an emphasis on the quality of non-English language directions. Our intuition is based on the hypothesis that a universal cross-language representation leads to better multilingual translation performance. To this end, we propose mRASP2, a training method to obtain a single unified multilingual translation model. mRASP2 is empowered by two techniques: a) a contrastive learning scheme to close the gap among representations of different languages, and b) data augmentation on both multiple parallel and monolingual data to further align token representations. For English-centric directions, mRASP2 outperforms existing best unified model and achieves competitive or even better performance than the pre-trained and fine-tuned model mBART on tens of WMT's translation directions. For non-English directions, mRASP2 achieves an improvement of average 10+ BLEU compared with the multilingual Transformer baseline. Code, data and trained models are available at https://github.com/PANXiao1994/mRASP2.
研究の動機と目的
- 多言語 NMT における異なる言語間の表現ギャップを埋め、すべての言語ペア間での知識移転を向上させること。
- 既存の多言語システムでしばしば性能が低い非英語翻訳方向の翻訳品質を向上させること。
- 英語中心ではない言語ペアにも良好に機能する統一された many-to-many 多言語モデルを構築すること。
- データの整合性を保ったまま、平行文書および単語文書の両方を効果的に活用し、表現学習を強化すること。
- 特にゼロショットおよび非教師あり翻訳において、mBART などの強力な二言語モデルと比較して、競争的または優れた性能を達成すること。
提案手法
- mRASP2 は、平行文書ペア(ポジティブペア)の表現間の距離を最小化し、非平行ペア(ネガティブペア)の距離を最大化する対照的学習スキームを採用する。
- 12層のエンコーダーとデコーダーを備えた多言語トランスフォーマーを用い、訓練の安定性を高めるために層正則化とプレノーマライゼーション付き残差接続を導入する。
- 複数の言語の入力および出力を可能にするために、各文の前に言語識別トークンを挿入する。
- 語彙辞書を用いて語を同義語に置き換えることで、平行文書および単語文書の両方に対してデータ増強を適用し、擬似平行または擬似自己平行な例を生成する。
- 実際の平行データと増強された擬似ペアの両方の学習を統合するため、標準的な交差エントロピー損失と対照的損失の組み合わせ損失関数を用いる。
- 対応するペアと非対応ペアのエンコーダー表現に対して対照的学習を適用し、言語間で意味的整合性を促進する。
実験結果
リサーチクエスチョン
- RQ1対照的学習は、多言語 NMT モデルにおける異なる言語間の表現ギャップを効果的に縮小できるか?
- RQ2平行文書および単語文書の両方におけるデータ増強は、特に低リソースまたは非英語翻訳方向において、多言語翻訳性能を向上させるか?
- RQ31つの統一されたモデルがピボットベースの手法に依存せずに、英語中心および非英語翻訳方向の両方で競争的な性能を達成できるか?
- RQ4many-to-many 多言語設定において、対照的学習はゼロショットおよび非教師あり翻訳性能をどの程度向上させるか?
- RQ5mRASP2 は、多様な WMT 翻訳ベンチマークにおいて、mBART などの強力な二言語モデルと比較してどの程度の性能を示すか?
主な発見
- 英語中心の翻訳方向では、mRASP2 は 20 個の WMT 翻訳方向で多言語トランスフォーマーのベースラインを上回り、10 個の WMT ベンチマークでは mBART と同等または優れた結果を達成する。
- 非英語翻訳方向では、mRASP2 は多言語トランスフォーマーのベースラインと比較して平均で 10 BLEU 以上の向上を達成する。
- ゼロショットおよび非教師あり翻訳では、mRASP2 は 36 個の翻訳方向で強力な結果を示し、ベースラインと比較して平均で 10 ポイント以上の BLEU 向上を達成する。
- すべての言語ペアで一貫した性能向上が見られ、効果的な多言語間知識移転が実現していることが示された。
- 可視化の結果、対照的学習が共有埋め込み空間における異なる言語間の表現ギャップを効果的に縮小していることが確認された。
- 対照的学習と整合性のあるデータ増強の組み合わせにより、より強固で汎用性の高い多言語表現が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。