Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Efficiently Extending Transformers for Long Input Summarization

Jason Phang, Yao Zhao|arXiv (Cornell University)|Aug 8, 2022
Topic Modeling被引用数 4
ひとこと要約

本稿では、学習済みのPEGASUSモデルの568Mパラメータ拡張版であるPEGASUS-Xを提案する。このモデルは、学習済みのグローバルトークンを備えた段階的でブロック局所的アテンション機構を用いて、最大16Kトークンの長文入力要約処理を効率的に行う。GovReportおよびPubMedのベンチマークで最先端の性能を達成するとともに、短い入力でも高い性能を維持しており、モデル並列化を一切行わず、パラメータ数の増加も最小限に抑えられたLongT5よりも優れた性能を発揮する。

ABSTRACT

While large pretrained Transformer models have proven highly capable at tackling natural language tasks, handling long sequence inputs continues to be a significant challenge. One such task is long input summarization, where inputs are longer than the maximum input context of most pretrained models. Through an extensive set of experiments, we investigate what model architectural changes and pretraining paradigms can most efficiently adapt a pretrained Transformer for long input summarization. We find that a staggered, block-local Transformer with global encoder tokens strikes a good balance of performance and efficiency, and that an additional pretraining phase on long sequences meaningfully improves downstream summarization performance. Based on our findings, we introduce PEGASUS-X, an extension of the PEGASUS model with additional long input pretraining to handle inputs of up to 16K tokens. PEGASUS-X achieves strong performance on long input summarization tasks comparable with much larger models while adding few additional parameters and not requiring model parallelism to train.

研究の動機と目的

  • 短い入力文用に事前学習されたTransformerのアーキテクチャを、長文入力要約処理に適応させるために最も効果的なアーキテクチャ的・事前学習的変更を特定すること。
  • 長文モデリングにおける、モデル効率性、メモリ使用量、性能のトレードオフを評価すること。
  • 従来の小規模〜中規模モデルを、再訓練なしに長文入力を処理できるように拡張するための実用的で低コストな手法を開発すること。
  • 短い入力での性能劣化を最小限に抑えつつ、長文入力要約処理タスクでの性能向上を最大化すること。
  • モデル並列化を必要とせず、大きなパラメータ数を必要としない、高パフォーマンスでパラメータ効率の良い長文入力要約用モデルをリリースすること。

提案手法

  • メモリと計算コストを削減しながら長距離モデリング能力を維持するため、段階的なブロック局所的アテンション機構を採用する。
  • グローバルな文脈を捉えるために、学習可能なグローバルトークン埋め込みを導入し、シーケンス長を延ばさずに性能向上を実現する。
  • 短いシーケンスで事前学習されたPEGASUSモデルから初期化した後、最大16Kトークンまでの長文シーケンスで追加の事前学習フェーズを実施する。
  • 計算オーバーヘッドを低減しながら性能を維持するため、T5の相対位置バイアスの代わりに正弦波位置埋め込みを採用する。
  • アブレーションスタディを通じて、エンコーダー・デコーダー層の配置とアテンションハイパーパramータを最適化する。
  • 元のPEGASUSモデルと同一の目的関数を用いて、長文入力要約データセットで微調整する。

実験結果

リサーチクエスチョン

  • RQ1長文入力要約処理に最適な、効率的でパラメータ効率の良いTransformerアーキテクチャのバリエーションは何か?
  • RQ2短いシーケンスでの事前学習から初期化した後、長文シーケンスで追加の事前学習を実施することで、微調整のみと比較して、下流の要約性能が顕著に向上するか?
  • RQ3位置エンコーディング方式の選択やグローバルトークンの統合といったアーキテクチャ的選択が、性能と効率に与える影響は何か?
  • RQ4小さな効率的なモデルが、モデル並列化や大規模なパラメータ数を必要とせずに、長文入力要約処理で最先端の結果を達成できるか?
  • RQ5短い文脈用に事前学習されたモデルを、長文文脈用のアーキテクチャに事前適応させることで、直接微調整するのと比較して、性能向上の程度はどの程度か?

主な発見

  • 段階的でブロック局所的アテンション機構に加え、学習可能なグローバルトークンを備えたTransformerアーキテクチャが、長文入力要約処理において性能と効率の最良のトレードオフを達成している。
  • 短いシーケンスで事前学習されたモデルから初期化した後、長文シーケンスで追加の事前学習を実施することで、長文のみの事前学習や適応なしの微調整と比較して、顕著に高い下流性能が得られる。
  • PEGASUS-Xは、GovReportおよびPubMedの長文入力要約ベンチマークで最先端の性能を達成しており、パラメータ数が少ないにもかかわらずLongT5よりも優れた性能を発揮する。
  • 短い入力要約タスクにおいても、性能劣化が最小限に抑えられており、入力長にかかわらず優れた汎化性能を示している。
  • 正弦波位置埋め込みは、性能のわずかな低下を伴いながらも、T5の相対位置バイアスを上回る速度性能を発揮するため、効率的な推論に適している。
  • 提案手法である、短い文脈モデルからの初期化、アーキテクチャの変更、長文シーケンスでの事前学習の追加というプロトコルは、既存モデルを長文文脈に拡張するうえで非常に効果的かつスケーラブルであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。