Skip to main content
QUICK REVIEW

[論文レビュー] Attention Temperature Matters in Abstractive Summarization Distillation

Shengqiang Zhang, Xingxing Zhang|arXiv (Cornell University)|Jun 7, 2021
Topic Modeling被引用数 6
ひとこと要約

この論文では、教師モデルの注目温度を引き上げて注目分布をなめらかにすることで、要約抽出の distillation を改善する Plate という手法を提案している。その結果、より短く要約的で、より抽象的な偽ラベルが得られ、3つの要約データセットにおいて、vanilla な偽ラベル化よりも一貫して優れた性能を示す学生モデルが得られた。

ABSTRACT

Recent progress of abstractive text summarization largely relies on large pre-trained sequence-to-sequence Transformer models, which are computationally expensive. This paper aims to distill these large models into smaller ones for faster inference and minimal performance loss. Pseudo-labeling based methods are popular in sequence-to-sequence model distillation. In this paper, we find simply manipulating attention temperatures in Transformers can make pseudo labels easier to learn for student models. Our experiments on three summarization datasets show our proposed method consistently improves over vanilla pseudo-labeling based methods. We also find that both the pseudo labels and summaries produced by our students are shorter and more abstractive. Our code is available at \url{https://github.com/Shengqiang-Zhang/plate}.

研究の動機と目的

  • 大規模な要約抽出モデルの distillation において、vanilla な偽ラベル化の限界、すなわち教師が生成する要約にコピーバイアスと先頭バイアスが生じることを是正すること。
  • 教師モデルの注目分布における過信を軽減することで、学生モデルに最適でない偽ラベルが生じるのを防ぐこと。
  • 滑らかな注目メカニズムを用いて、より短く多様な要約を生成することで、distilled 学生モデルの抽象的品質を向上させること。
  • 教師モデルにおける温度制御付き注目が、学生モデルの再訓練なしに distillation 性能を向上させるかどうかを検証すること。
  • よりなめらかな注目分布が、学生モデルの一般化性能とより抽象的な挙動を向上させるかどうかを検証すること。

提案手法

  • 教師モデルのドット積注目メカニズムにおけるロジットを温度スケーリング係数 λ で再スケーリングし、よりなめらかな注目分布を生成する。
  • λ > 1.0 の修正済み教師モデルを用いて、学生モデルの学習用に偽ラベルを生成し、標準的な注目ではなく、より高い温度の注目を適用する。
  • vanilla な偽ラベル化と同一の学習目的を採用するが、なめらかな注目を持つ教師から得た偽ラベルを用いることで、より良い一般化が可能になる。
  • 入力トークンの位置を [0.0, 1.0] に正規化し、文書の各ブロックにおける顕著な注意重み(≥0.15)の分布を分析することで、バイアス低減を定量的に評価する。
  • 温度が注目エントロピーに与える影響を評価し、予測エントロピーおよび生成行動(コピー対生成)と相関をとるかを検証する。
  • クロス注目重みを可視化することで、高い λ によってコピーバイアス(短い注目線)と先頭バイアス(広がった注目分布)が顕著に減少することを定性的に示す。

実験結果

リサーチクエスチョン

  • RQ1教師モデルの注目温度を引き上げることで、生成された偽ラベルにおけるコピーバイアスと先頭バイアスは低減するか?
  • RQ2教師モデルにおけるなめらかな注目分布は、学生モデルがより抽象的かつ短く要約的な要約を生成するのを助けるか?
  • RQ3温度スケーリングが注目分布および予測分布のエントロピーに与える影響は何か? また、生成行動(コピー対生成)と相関があるか?
  • RQ4Plate は複数の要約抽出ベンチマークで一貫して distillation 性能を向上させるか?
  • RQ5教師モデルにおける高い温度の利点は、要約を超えた他の系列対系列タスクにも一般化可能か?

主な発見

  • Plate は、CNN/DailyMail、XSum、NYT の3つのデータセットにおいて、vanilla な偽ラベル化よりも一貫して ROUGE スコアを向上させ、特に ROUGE-L で顕著な向上を示した。
  • CNN/DailyMail では、Plate によって生成された偽ラベルで学習した学生モデルが ROUGE-L スコア 44.92 を達成したのに対し、標準的な偽ラベル化では 44.71 であった。
  • 高い温度の教師から得た偽ラベルでは、元の文書からコピーされる 4-grams の割合が 56% にまで上昇したが、参照要約では 15% にとどまっているため、コピーバイアスが低減され、抽象度が向上していることが示された。
  • 顕著なクロス注目重み(≥0.15)の分布は、λ=1.0 の場合、最初の 200 語に集中していたのに対し、λ=2.0 の場合、最初の 450 語にシフトした。これは、先頭バイアスが低減されたことを示している。
  • Plate を用いて学習された学生モデルの要約は、著しくより抽象的かつ短く、より多くの新しい n-gram を含み、コピー率が低く抑えられている。
  • この手法は他のタスクにも一般化可能である:WMT16 英語=ドイツ語翻訳タスクでは、Plate が 27.90 の BLEU スコアを達成したのに対し、標準的な偽ラベル化では 27.79 であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。