Skip to main content
QUICK REVIEW

[論文レビュー] Noisy Self-Knowledge Distillation for Text Summarization

Yang Liu, Sheng Shen|arXiv (Cornell University)|Sep 15, 2020
Topic Modeling参考文献 60被引用数 11
ひとこと要約

本稿では、教師モデルのなめらかにした出力分布を模倣するように学生モデルを訓練するが、訓練中に教師および学生の両方にノイズを注入することで、ロバスト性を向上させる、ノイズを含む自己知識蒸留(Noisy SKD)を提案する。この手法は、ノイズが多いまたは単一のリファレンスのみを用いたデータセットにおいても、一般化性能を向上させ、幻覚を低減することで、CNN/DailyMail、XSum、WikiCatSumで最先端の結果を達成する。

ABSTRACT

In this paper we apply self-knowledge distillation to text summarization which we argue can alleviate problems with maximum-likelihood training on single reference and noisy datasets. Instead of relying on one-hot annotation labels, our student summarization model is trained with guidance from a teacher which generates smoothed labels to help regularize training. Furthermore, to better model uncertainty during training, we introduce multiple noise signals for both teacher and student models. We demonstrate experimentally on three benchmarks that our framework boosts the performance of both pretrained and non-pretrained summarizers achieving state-of-the-art results.

研究の動機と目的

  • 教師モデルの出力分布をなめらかにすることで、教師モデルの出力分布をなめらかにし、最大尤度訓練の限界、特にノイズが多いまたは単一のリファレンスのみを用いたデータセットにおける限界を克服すること。
  • なめらかにしたラベル分布を用いた知識蒸留を活用することで、幻覚を低減し、一般化性能を向上させること。
  • 訓練中に教師および学生モデルの両方に複数のノイズ信号を導入することで、ロバスト性を向上させること。
  • 単一文書および複数文書の両方の設定を含む、多様な要約ベンチマークにおける性能を向上させること。
  • 事前学習済みおよび非事前学習済みの要約モデルアーキテクチャの両方で最先端の結果を達成すること。

提案手法

  • 学生モデルは、教師モデルがターゲットトークンの確率分布をなめらかに生成することで、学生をガイドする知識蒸留を用いて訓練される。
  • 訓練シグナルにドロップアウトと単語マスキングを適用することで、教師および学生モデルの両方の前方伝搬中にノイズを注入する。
  • 複数のノイズ信号を訓練中に適用することで、不確実性をシミュレートし、モデルの一般化性能を向上させる。
  • 訓練では1つのリファレンスを使用するが、教師の出力分布を活用して要約における人間のばらつきを捉える。
  • 非事前学習済みおよび事前学習済みモデル(例:UniLMv2)の両方に対して適用され、ファインチューニング時に蒸留が適用される。
  • 教師モデルはまず同じデータで事前学習され、その出力分布が学生のソフトラベルとして使用される。

実験結果

リサーチクエスチョン

  • RQ1なめらかにしたラベル分布を用いた自己知識蒸留は、ノイズが多く、単一のリファレンスのみを用いたデータセットにおいて、要約性能を向上させることができるか?
  • RQ2教師および学生モデルの両方にノイズを注入することで、抽象的要約におけるモデルの一般化性能およびロバスト性にどのような影響を与えるか?
  • RQ3教師モデルを用いた知識蒸留は、生成された要約における事実の整合性を向上させ、幻覚を低減するか?
  • RQ4提案されたフレームワークは、CNN/DailyMail、XSum、WikiCatSumを含む多様な要約ベンチマークで最先端の結果を達成できるか?
  • RQ5より小さいにもかかわらず、情報量と要約の簡潔さの点で、蒸留された学生モデルは教師モデルを上回ることができるか?

主な発見

  • ノイズを含むSKDフレームワークは、CNN/DailyMail、XSum、WikiCatSumで最先端のROUGEスコアを達成し、教師モデル(UniLMv2 BASE)およびベースラインの蒸留手法を上回った。
  • CNN/DailyMailおよびXSumでは、人間評価者により、蒸留された学生モデルが教師モデルよりも顕著に簡潔で情報量が多く、かつやや言語としての流暢さが劣ると評価された(p < 0.05)。
  • WikiCatSumデータセットでは、動物および映画のドメインで学生モデルが教師モデルを上回ったが、企業ドメインではエンティティの過剰生成により苦戦した。
  • この手法は、非事前学習済みおよび事前学習済みモデルの両方で性能を向上させ、広範な適用可能性を示した。
  • 複数のノイズ信号の導入により、モデルの一般化性能が向上し、過学習が軽減され、ノイズの多い訓練データに対するロバスト性が向上した。
  • より小さいにもかかわらず、ROUGEスコアおよび情報量と簡潔さの点で人間評価においても、教師モデルを上回る性能を学生モデルが達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。