Skip to main content
QUICK REVIEW

[論文レビュー] On Sparsifying Encoder Outputs in Sequence-to-Sequence Models

Biao Zhang, Ivan Titov|Zurich Open Repository and Archive (University of Zurich)|Apr 24, 2020
Topic Modeling参考文献 30被引用数 7
ひとこと要約

本稿では、変換器ベースの系列対系列モデルにおけるエンコーダ出力を最大70%までプルーニングしても性能に顕著な低下がない、微分可能でスパarsityを誘導するレイヤー「L₀ Drop」を提案する。確率的ゲートにL₀罰則を適用することで、情報のない入力表現(特に機能語や標点記号)をマスクする方法を学習する。要約タスクにおいて、最大1.65倍の高速化が達成され、生成品質は競争力のある水準を維持する。

ABSTRACT

Sequence-to-sequence models usually transfer all encoder outputs to the decoder for generation. In this work, by contrast, we hypothesize that these encoder outputs can be compressed to shorten the sequence delivered for decoding. We take Transformer as the testbed and introduce a layer of stochastic gates in-between the encoder and the decoder. The gates are regularized using the expected value of the sparsity-inducing L0penalty, resulting in completely masking-out a subset of encoder outputs. In other words, via joint training, the L0DROP layer forces Transformer to route information through a subset of its encoder states. We investigate the effects of this sparsification on two machine translation and two summarization tasks. Experiments show that, depending on the task, around 40-70% of source encodings can be pruned without significantly compromising quality. The decrease of the output length endows L0DROP with the potential of improving decoding efficiency, where it yields a speedup of up to 1.65x on document summarization tasks against the standard Transformer. We analyze the L0DROP behaviour and observe that it exhibits systematic preferences for pruning certain word types, e.g., function words and punctuation get pruned most. Inspired by these observations, we explore the feasibility of specifying rule-based patterns that mask out encoder outputs based on information such as part-of-speech tags, word frequency and word position.

研究の動機と目的

  • 系列対系列モデルにおけるエンコーダ出力が、不要または情報のない表現を除去することで圧縮可能かどうかを調査すること。
  • エンコーダ状態のシーケンス長を短縮することで、デコードの計算複雑度を低減すること。
  • 動的エンコーダ出力スパース化のための微分可能でエンドツーエンドで学習可能な手法を開発すること。
  • データ駆動型スパース化(L₀ Drop)がさまざまなタスクに一般化するか、ルールベースのパターンが有効かつ転送可能かどうかを評価すること。
  • どのような語の種類(例:機能語、標点記号)が優先的にプルーニングされるかを分析し、効率的な推論に活用できるかを検討すること。

提案手法

  • 変換器モデルのエンコーダとデコーダの間に配置された、微分可能なスパース化レイヤー「L₀ Drop」を導入する。
  • L₀ Dropは、二値の確率的ゲートを用い、微分可能近似によりエンコーダ出力を正確にゼロにすることで、完全なマスクを可能にする。
  • スパース性は、損失関数にL₀罰則の期待値を加えることで誘導され、ゲート値がゼロになるよう促進される。
  • この手法はエンドツーエンドで学習可能であり、モデルが冗長で安全にプルーニング可能なエンコーダ出力を学習できる。
  • O(NM)からO(N′M)に計算複雑度を低減するための特別なデコードアルゴリズムを導入し、N′ < Nとなる。
  • L₀ Dropの挙動を分析した上で、品詞タグ、語の頻度、位置ベースのフィルタリング(例:奇数位置のみ)を含む、ルールベースのスパースパターンを設計する。

実験結果

リサーチクエスチョン

  • RQ1系列対系列モデルにおけるエンコーダ出力は、生成品質に顕著な低下を来さずに効果的にプルーニング可能か?
  • RQ2エンコーダ出力のプルーニングは、デコード効率の向上に顕著な効果をもたらすか?
  • RQ3L₀ Drop機構によって優先的にプルーニングされる語の種類(例:機能語、内容語)は何か?
  • RQ4品詞タグ、頻度、位置に基づくルールベースのスパースパターンは、データ駆動型L₀ Dropと同等の性能を達成できるか?
  • RQ5ルールベースのスパースパターンは、機械翻訳や要約といった異なるタスク間で一般化可能か?

主な発見

  • WMT14 En-Deで、L₀ Dropを用いることで最大70%のエンコーダ出力をプルーニングしても、生成品質に顕著な影響がなく、BLEUスコアはベースラインから0.5ポイント以内に留まる。
  • ドキュメント要約タスクでは、L₀ Dropによりデコーダへの入力長が短縮され、デコード速度が最大1.65倍に向上する。
  • L₀ Dropは、機能語、標点記号、頻度の高い語を体系的にプルーニングするが、希少で内容の濃い語の表現は保持する。
  • 品詞タグフィルタリングや頻度ベースのプルーニングといったルールベースのパターンは、翻訳タスクでL₀ Dropと同等の性能(例:46.7%のスパース、BLEU 27.11)を達成するが、要約タスクには一般化できない。
  • グループパターン(偶数位置の符号化をプルーニング)は、CNN/Daily Mailで顕著な性能低下(−5.82 ROUGE-L)を引き起こし、タスク間での一般化性が低いことが示された。
  • 逆頻度パターン(希少語をプルーニング)は性能が低く、頻度の高い語が情報量が少なく、より圧縮可能であるという情報理論的直観を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。