Skip to main content
QUICK REVIEW

[論文レビュー] Duplex Sequence-to-Sequence Learning for Reversible Machine Translation

Zaixiang Zheng, Hao Zhou|arXiv (Cornell University)|May 7, 2021
Natural Language Processing Techniques参考文献 38被引用数 10
ひとこと要約

本稿では、一様なTransformerアーキテクチャに基づく可逆なデュプレックスシーケンス・ツー・シーケンスモデル、REDERを提案する。このモデルは、単一の統合ネットワークを用いて双方向機械翻訳を実現する。可逆な残差接続と非自己回帰的デコードを活用することで、REDERは最先端の性能を達成し、WMT14 En-Deでマルチタスクベースラインを最大1.3 BLEU上回り、En-Jaのような遠隔言語対に対しても優れた一般化性能を示す。

ABSTRACT

Sequence-to-sequence learning naturally has two directions. How to effectively utilize supervision signals from both directions? Existing approaches either require two separate models, or a multitask-learned model but with inferior performance. In this paper, we propose REDER (Reversible Duplex Transformer), a parameter-efficient model and apply it to machine translation. Either end of REDER can simultaneously input and output a distinct language. Thus REDER enables reversible machine translation by simply flipping the input and output ends. Experiments verify that REDER achieves the first success of reversible machine translation, which helps outperform its multitask-trained baselines by up to 1.3 BLEU.

研究の動機と目的

  • 既存のマルチタスクおよびサイクル学習手法における、特にパラメータ干渉と最適でない性能という限界を解消すること。
  • 対称的かつ可逆なネットワークアーキテクチャを設計することで、1つのモデルが送り先から受信先、受信先から送り先への翻訳を両方可能とする、真の可逆機械翻訳を実現すること。
  • 全再トレーニングを伴わずに言語固有のエンドから合成可能なモデルを構築することで、多言語環境におけるトレーニングおよびデプロイコストを低減すること。
  • さまざまな言語対において、サイクル整合性を維持しつつ高い翻訳品質を達成する統合的かつパラメータ効率的なモデルの可能性を検討すること。

提案手法

  • 両端が対称的かつ符号化・復号化が可能なデュプレックスTransformerアーキテクチャを設計し、単一の共有モデルを用いて可逆翻訳を実現する。
  • Gomezら(2017)のインスパイドされた可逆残差接続機構を導入し、順方向および逆方向の両方のプロパゲーションで隠れ状態を正確に逆算可能にする。
  • 標準的な自己回帰的デコードを完全な非自己回帰的(NAT)モデリングに置き換え、対称性を保ちつつ情報の双方向的流れを可能にする。
  • 平行データの両方向を同時に学習し、再構成損失を用いてサイクル整合性を強制する。
  • 自己回帰的教師モデルからの知識蒸留(KD)を適用し、非自己回帰的生成の品質を向上させる。
  • 言語固有のエンド(例:En↔DeのDeエンドとEn↔JaのJaエンド)を組み合わせることで、事前に接続されていなかった言語間のゼロショット翻訳を可能にする。

実験結果

リサーチクエスチョン

  • RQ11つの統合ニューラルネットワークが、それぞれの方向用に別々のモデルを用意することなく、高品質な可逆機械翻訳を達成できるか?
  • RQ2対称的かつ可逆なコンponentsを備えたデュプレックスアーキテクチャは、共有パラメータを用いたマルチタスク学習に比べ、翻訳品質および一般化性能で優れるか?
  • RQ3提案手法は、語彙の重複が最小限の遠隔言語対(例:英語と日本語)に対しても一般化できるか?
  • RQ4可逆的かつ合成的設計により、多言語翻訳システムのトレーニングおよびデプロイコストをどの程度低減できるか?
  • RQ5可逆的かつ対称的なアーキテクチャにおいて、知識蒸留は非自己回帰的生成の品質向上にどの程度効果的か?

主な発見

  • REDERは、WMT14英語-ドイツ語翻訳ベンチマークでマルチタスク学習ベースラインを最大1.3 BLEU上回り、優れた性能を示した。
  • WMT20英語-日本語翻訳タスクでは、強力な自己回帰的モデルと比較して競争力のある結果(En-Ja: 20.0/20.7 BLEU、Ja-En: 20.7 BLEU)を達成し、遠隔言語への優れた一般化性能を示した。
  • WMT14 En-De開発セットにおいて、再構成BLEUスコアが66.0に達し、実際の可逆性およびサイクル整合性の強さを裏付けた。
  • 定性的な事例研究では、入力文が前向きおよび逆方向の翻訳後に正確に再構成されており、わずかな言語的変化の差異を除いては正確な再現が確認された。
  • 合成的設計により、事前に学習済みのEn↔DeおよびEn↔Jaモデルのエンドを組み合わせることで、ドイツ語と日本語間のゼロショット翻訳が可能となり、モジュール式のスケーラビリティを示した。
  • ビームサーチとATリランゲージングを用いた非自己回帰的推論により、トレーニング時に自己回帰的生成が行われないにもかかわらず、高品質な出力を得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。