Skip to main content
QUICK REVIEW

[论文解读] LongT5: Efficient Text-To-Text Transformer for Long Sequences

Mandy Guo, Joshua Ainslie|arXiv (Cornell University)|Dec 15, 2021
Topic Modeling被引用 6
一句话总结

LongT5 提出了一种可扩展的 Transformer 架构,通过同时增加输入序列长度和模型规模,在长上下文 NLP 任务中实现了性能提升。它采用了一种新颖的 TGlobal 注意力机制——在无需额外输入的情况下模仿 ETC 的局部/全局注意力机制——并结合 PEGASUS 风格的预训练方法,在 arXiv、PubMed 和 BigPatent 等摘要和问答基准测试中实现了最先进性能,支持高达 16k 的输入 token。

ABSTRACT

Recent work has shown that either (1) increasing the input length or (2) increasing model size can improve the performance of Transformer-based neural models. In this paper, we present a new model, called LongT5, with which we explore the effects of scaling both the input length and model size at the same time. Specifically, we integrated attention ideas from long-input transformers (ETC), and adopted pre-training strategies from summarization pre-training (PEGASUS) into the scalable T5 architecture. The result is a new attention mechanism we call {\em Transient Global} (TGlobal), which mimics ETC's local/global attention mechanism, but without requiring additional side-inputs. We are able to achieve state-of-the-art results on several summarization tasks and outperform the original T5 models on question answering tasks.

研究动机与目标

  • 探索在 Transformer 模型中同时扩展输入长度和模型规模所带来的性能增益。
  • 通过引入一种高效的注意力机制,解决长序列中完整自注意力机制带来的二次方计算成本问题。
  • 将 PEGASUS 风格的预训练方法适配于抽象式摘要任务,以提升在多样化长序列任务上的表现。
  • 在无需架构大改或额外输入的前提下,实现长文档的可扩展、高性能文本到文本建模。
  • 开源模型架构、训练代码和预训练检查点,供社区使用。

提出的方法

  • 提出 TGlobal 注意力,作为标准自注意力的即插即用替代方案,能够从输入 token 分组中实时合成全局 token,实现在无需外部输入的情况下实现局部稀疏性。
  • 将 PEGASUS 预训练目标进行适配——对关键句子进行掩码,并要求自回归生成被掩码的片段——以提升在长上下文任务中的表现。
  • 仅在编码器中引入 TGlobal 注意力,扩展 T5 架构,同时保持与现有 T5 流水线和推理框架的兼容性。
  • 采用两阶段训练策略:首先在长文档上使用片段损坏和关键句子生成进行预训练,随后在下游任务上进行微调。
  • 同时扩展模型规模和输入长度,在内存限制下推动可行性的边界。
  • 采用分层注意力设计,其中局部注意力将计算限制在相邻 token 上,而全局 token 则支持长距离依赖建模。

实验结果

研究问题

  • RQ1同时扩展输入长度和模型规模是否能在长上下文 NLP 任务中带来显著的性能提升?
  • RQ2在长序列上,TGlobal 注意力与完整自注意力及其他稀疏注意力机制相比,在性能和效率方面表现如何?
  • RQ3PEGASUS 风格的预训练是否能超越摘要任务,在长上下文任务中提升泛化能力?
  • RQ4在长上下文建模中,模型规模、输入长度和计算成本之间的权衡关系是什么?
  • RQ5在不进行架构修改的前提下,改进后的 T5 模型能否在长序列摘要和问答基准测试中达到最先进水平?

主要发现

  • 在 arXiv 摘要数据集上,LongT5 达到了最先进 ROUGE 分数,在 16k 输入长度下 R-L 的 F1 得分为 44.03,优于所有基线模型。
  • 在 PubMed 摘要任务中,LongT5 在 16k 输入长度下达到 46.56 的 R-L F1 分数,比之前最佳模型 PSG 高出 1.53 分。
  • 消融实验表明,PEGASUS 风格预训练(PSG)在 arXiv 和 PubMed 数据集上均比片段损坏方法(SC)高出 1.2–1.5 个 ROUGE 分数。
  • TGlobal 注意力使 LongT5 能够在仅带来轻微性能损失的情况下扩展至 16k 输入长度,同时保持了二次方复杂度的降低。
  • LongT5 在 BigPatent、MediaSum 和 TriviaQA 上也实现了 SOTA 结果,证明其在摘要任务之外具有广泛适用性。
  • 即使在长序列上进行微调,模型仍保持强劲性能,证实了联合扩展策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。