Skip to main content
QUICK REVIEW

[論文レビュー] Cseq2seq: Cyclic Sequence-to-Sequence Learning

Biao Zhang, Deyi Xiong|arXiv (Cornell University)|Jul 29, 2016
Natural Language Processing Techniques参考文献 19被引用数 4
ひとこと要約

本稿では、Cseq2seqを提案する。これは、前のデコードの隠れ状態を繰り返しエンコーダーにフィードバックすることで、シーケンス・トゥ・シーケンスモデルの性能を向上させる周期的シーケンス・トゥ・シーケンス学習フレームワークである。部分的なターゲットシーケンスに基づいて翻訳に関連するソーストークンを動的に検出するRNNを用いることで、Cseq2seq-IIはパrameter共有によりエンコーダーとデコーダー間でパラメータを共有することで、31%少ないパラメータでアテンションベースのモデルと同等の性能を達成する。

ABSTRACT

The vanilla sequence-to-sequence learning (seq2seq) reads and encodes a source sequence into a fixed-length vector only once, suffering from its insufficiency in modeling structural correspondence between the source and target sequence. Instead of handling this insufficiency with a linearly weighted attention mechanism, in this paper, we propose to use a recurrent neural network (RNN) as an alternative (Cseq2seq-I). During decoding, Cseq2seq-I cyclically feeds the previous decoding state back to the encoder as the initial state of the RNN, and reencodes source representations to produce context vectors. We surprisingly find that the introduced RNN succeeds in dynamically detecting translationrelated source tokens according to the partial target sequence. Based on this finding, we further hypothesize that the partial target sequence can act as a feedback to improve the understanding of the source sequence. To test this hypothesis, we propose cyclic sequence-to-sequence learning (Cseq2seq-II) which differs from the seq2seq only in the reintroduction of previous decoding state into the same encoder. We further perform parameter sharing on Cseq2seq-II to reduce parameter redundancy and enhance regularization. In particular, we share the weights of the encoder and decoder, and two targetside word embeddings, making Cseq2seq-II equivalent to a single conditional RNN model, with 31% parameters pruned but even better performance. Cseq2seq-II not only preserves the simplicity of seq2seq but also yields comparable and promising results on machine translation tasks. Experiments on Chinese- English and English-German translation show that Cseq2seq achieves significant and consistent improvements over seq2seq and is as competitive as the attention-based seq2seq model.

研究の動機と目的

  • 従来のシーケンス・トゥ・シーケンスモデルがソースとターゲットのシーケンス間の構造的対応を捉えることの制限を解決すること。
  • 固定長のコンテキストベクトルのボトルネックを克服し、デコード中にソースシーケンスの動的で再帰的な再エンコーディングを可能にすること。
  • 部分的なターゲットシーケンスが翻訳中のソース理解を向上させるフィードバックとして機能するかどうかを調査すること。
  • エンコーダーとデコーダー間のパラメータ共有、および単語埋め込み間の共有を通じてモデルの複雑さを低減し、正則化を強化すること。
  • 単一の条件付きRNNアーキテクチャが、明示的なアテンション機構を用いずに、標準的なseq2seqを上回り、最先端のアテンションベースのモデルと同等の性能を示すかどうかを実証すること。

提案手法

  • GRUを用いて、前のデコード状態を初期隠れ状態として使用して、エンコーダーで生成されたソース表現を処理するCseq2seq-Iを提案する。
  • Cseq2seq-IIを導入し、各デコードステップでデコーダーの前の隠れ状態をエンコーダーに再帰的にフィードバックすることで、ソースシーケンスの動的再エンコーディングを可能にする。
  • エンコーダーとデコーダーのRNN間、および2つのターゲット側の単語埋め込み間でパラメータ共有を実装し、モデルパラメータを31%削減する。
  • 標準的なseq2seq学習目的関数に従い、周期的フィードバックループを除いて標準seq2seqフレームワークに変更を加えずに、エンド・ツー・エンドでモデルを学習する。
  • GRUの更新ゲートとリセットゲートを用いて、明示的なアテンション計算を伴わず、ソースとターゲットトークン間の整合性と関連性を暗黙的に学習する。
  • BLEUやアライメントエラーレート(AER)などの標準指標を用いて、中国語-英語および英語-ドイツ語翻訳タスクでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1アテンション機構の代替として、RNNを用いてシーケンス・トゥ・シーケンス学習におけるソース-ターゲット依存関係をモデル化できるか?
  • RQ2デコーダーの隠れ状態をエンコーダーにフィードバックすることで、デコード中のソース表現学習が向上するか?
  • RQ3エンコーダーとデコーダー間のパラメータ共有が、モデルの複雑さを低減しつつ性能を維持または向上できるか?
  • RQ4周期的再エンコーディング機構が、明示的なアテンション機構を用いずに、単語アライメントを暗黙的に学習できるか?
  • RQ5提案されたCseq2seqフレームワークは、従来のseq2seqおよび最先端のアテンションベースのモデルと比較して、機械翻訳タスクでどのように性能を発揮するか?

主な発見

  • Cseq2seq-Iは、GRUの隠れ状態と入力表現のみを用いて、各デコードステップで翻訳に関連するソーストークンを効果的に検出でき、暗黙的なアテンションに類似した挙動を示した。
  • Cseq2seq-IIは中国語-英語および英語-ドイツ語翻訳タスクの両方で、従来のseq2seqよりも顕著かつ一貫した改善を達成し、BLEUスコアで標準seq2seqを上回った。
  • パラメータ共有により31%のパラメータ削減を達成しながらも、パラメータ共有されたエンコーダーとデコーダーRNNが個別に構築されたものよりも効果的であることが示された。
  • モデルは、パラメータを31%削減しながら性能を向上させた。これは、共有されたエンコーダーとデコーダーRNNが個別な構造よりも効果的である可能性を示している。
  • GRUの更新ゲートは単語アライメントの質と相関しており、低レベルのアライメントエラーレート(AER)を達成した。これは、モデルが意味的なソース-ターゲット対応関係を暗黙的に学習していることを示している。
  • 周期的フィードバック機構により、エンコーダーとデコーダー間で双方向の情報フローが可能となり、翻訳の進行状況に応じて未翻訳のソーストークンに適応的に注目できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。