Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Machine Translation with Disentangled Context Transformer

Jungo Kasai, James Cross|arXiv (Cornell University)|Jan 15, 2020
Natural Language Processing Techniques被引用数 23
ひとこと要約

本稿では、注意マスクを用いて任意の参照トークンの部分集合に条件づけられるようにすることで、文脈の分離を実現する非自己回帰的神経機械翻訳モデルであるDisentangled Context (DisCo) Transformerを提案する。このモデルは、すべての出力トークンを並列に生成することで、7つの翻訳方向において、著しく短縮されたデコード時間で最先端の翻訳品質を達成する。

ABSTRACT

State-of-the-art neural machine translation models generate a translation from left to right and every step is conditioned on the previously generated tokens. The sequential nature of this generation process causes fundamental latency in inference since we cannot generate multiple tokens in each sentence in parallel. We propose an attention-masking based model, called Disentangled Context (DisCo) transformer, that simultaneously generates all tokens given different contexts. The DisCo transformer is trained to predict every output token given an arbitrary subset of the other reference tokens. We also develop the parallel easy-first inference algorithm, which iteratively refines every token in parallel and reduces the number of required iterations. Our extensive experiments on 7 translation directions with varying data sizes demonstrate that our model achieves competitive, if not better, performance compared to the state of the art in non-autoregressive machine translation while significantly reducing decoding time on average. Our code is available at this https URL.

研究の動機と目的

  • 左から右へのトークン生成に起因する自己回帰的神経機械翻訳における遅延ボトル neck 問題を解決すること。
  • 翻訳品質を損なうことなく、すべての出力トークンを並列に生成することを可能にすること。
  • 各出力トークンを多様な参照トークンの部分集合に条件づける訓練フレームワークを構築し、モデルの頑健性と一般化性能を向上させること。
  • 収束を加速するために、すべてのトークンを同時に繰り返し精錬する効率的な推論アルゴリズムを設計すること。
  • 多様な翻訳方向およびデータサイズにおいて強力な性能を示し、精度と速度の両面で最先端の非自己回帰モデルを上回るか同等の性能を発揮すること。

提案手法

  • 各出力トークンが他の参照トークンの任意の部分集合に注目できるようにする注意マスク機構を提案し、文脈の分離モデリングを可能にする。
  • 任意の参照シーケンスの部分集合を入力として各出力トークンを予測するようにモデルを訓練し、部分的文脈に対する頑健性を高める。
  • 並列的で簡単な順序の推論アルゴリズム(parallel easy-first inference algorithm)を設計し、すべてのトークンを同時に繰り返し精錬することで、必要なデコードイテレーション数を削減する。
  • 文脈の分離構成をサポートするように修正されたクロス注意メカニズムを用いた標準的なTransformerアーキテクチャを採用する。
  • 訓練中に段階的な学習戦略(curriculum learning strategy)を適用し、監視に使用する文脈部分集合の複雑さを徐々に増加させる。
  • 標準的なseq2seq訓練目的関数と標準的なトークン化・正規化手法を用いるが、注目すべきは注意マスクと訓練目的関数の設計に集中すること。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的Transformerモデルは、出力トークンの完全な並列生成を可能にしつつ、競争力のある翻訳品質を達成できるか?
  • RQ2各出力トークンを参照トークンの任意の部分集合に条件づけることで、モデルの頑健性と性能がどのように向上するか?
  • RQ3提案された並列的で簡単な順序の推論アルゴリズムは、標準的な非自己回帰的または自己回帰的手法と比較して、どれほどデコード時間を短縮できるか?
  • RQ4既存の非自己回帰ベースラインと比較して、多様な翻訳方向および変動するデータサイズにおいて、このモデルはどのように性能を発揮するか?
  • RQ5文脈の分離機構は、推論中の一般化性能の向上と収束の加速に寄与するか?

主な発見

  • DisCo Transformerは、7つの翻訳方向において、最先端の非自己回帰モデルと同等またはそれ以上の翻訳性能を達成する。
  • 平均して著しく短縮されたデコード時間を実現し、並列的で簡単な順序の推論戦略の有効性を示している。
  • 注意マスクに基づく訓練方式により、多様な文脈部分集合を用いた各出力トークンの予測が頑健に実現され、一般化性能が向上している。
  • 限定的な学習データでも強力な性能を維持しており、文脈の分離設計に起因する強いインダクティブバイアスがあることが示唆される。
  • すべてのトークンを同時に効率的に精錬することで、並列推論アルゴリズムは必要なイテレーション数を削減している。
  • 多様な言語対において一般化が良く、性能の著しい低下を伴わずに推論速度が一貫して向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。