Skip to main content
QUICK REVIEW

[論文レビュー] Synchronous Bidirectional Inference for Neural Sequence Generation

Jiajun Zhang, Long Zhou|arXiv (Cornell University)|Feb 24, 2019
Natural Language Processing Techniques参考文献 38被引用数 8
ひとこと要約

本稿では、系列生成中に左右両方向のデコードを並列に進行させるとともに相互に作用させる同期型双方向推論モデルを提案する。新たなビームサーチアルゴリズムと同期型アテンションメカニズムを導入することで、モデルは同時に過去と未来の文脈を活用でき、機械翻訳および要約抽出タスクにおいて強力なベースラインを著しく上回る性能向上を達成した。

ABSTRACT

In sequence to sequence generation tasks (e.g. machine translation and abstractive summarization), inference is generally performed in a left-to-right manner to produce the result token by token. The neural approaches, such as LSTM and self-attention networks, are now able to make full use of all the predicted history hypotheses from left side during inference, but cannot meanwhile access any future (right side) information and usually generate unbalanced outputs in which left parts are much more accurate than right ones. In this work, we propose a synchronous bidirectional inference model to generate outputs using both left-to-right and right-to-left decoding simultaneously and interactively. First, we introduce a novel beam search algorithm that facilitates synchronous bidirectional decoding. Then, we present the core approach which enables left-to-right and right-to-left decoding to interact with each other, so as to utilize both the history and future predictions simultaneously during inference. We apply the proposed model to both LSTM and self-attention networks. In addition, we propose two strategies for parameter optimization. The extensive experiments on machine translation and abstractive summarization demonstrate that our synchronous bidirectional inference model can achieve remarkable improvements over the strong baselines.

研究の動機と目的

  • 従来の左から右への系列生成では、初期トークンは正確であるが後続のトークンは精度が低くなるという偏りを是正すること。
  • 推論中に左右両方向のデコードが相互に作用できるようにし、未来の予測を用いて現在の出力を改善すること。
  • 左から右と右から左の推論に別々のモデルを訓練する必要のない統一されたモデルアーキテクチャを設計すること。
  • 2つの提案された戦略を用いてモデルパラメータを効果的に最適化し、系列変換タスクにおける性能を向上させること。

提案手法

  • 左から右と右から左のデコードに別々のビームを維持しつつ、各デコードステップで両方向間の情報交換を可能にする、新しいビームサーチアルゴリズムを提案する。
  • 各デコーダーが自らの履歴と反対方向が生成した未来の予測の両方を参照できる、同期型アテンションメカニズムを導入する。
  • 単一のデコーダー構造を採用し、双方向デコードをサポートすることで、独立した2つのモデルを訓練する必要を排除する。
  • 双方向デコードパス間の整合性を高め、学習効率を向上させるために、2つのパラメータ最適化戦略を設計する。
  • 広範な適用性を確保するため、LSTMベースおよびTransformerベースの系列変換モデルの両方へ本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1同期型双方向デコードは、系列変換タスクにおける生成系列のバランスと全体的な品質を向上させることができるか?
  • RQ2別々のモデルを必要とせずに、右から左のデコードから得られる未来の文脈を左から右の生成に効果的に統合できるか?
  • RQ3左から右と右から左のデコーダー間で、相互にリアルタイムで情報交換を行うことで、逐次的または独立的な手法よりも優れた性能が得られるか?
  • RQ4提案手法は、機械翻訳や要約抽出といった多様な系列生成タスクにおいて一貫した性能向上を達成できるか?

主な発見

  • 提案された同期型双方向推論モデルは、機械翻訳および要約抽出タスクにおいて、強力な左から右ベースラインを著しく上回る性能向上を達成した。
  • NIST中国語-英語翻訳タスクにおいて、頭部と末尾のトークンの精度差を縮小し、よりバランスの取れた予測を達成した。
  • 従来の左から右または右から左の推論と比較して、最初の4トークンおよび最後の4トークンの一致精度が向上し、全体的な系列品質の向上を示している。
  • 広範な実験により、モデルが推論中に過去と未来の両方の文脈を効果的に活用でき、より一貫性があり正確な出力を得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。