[论文解读] LongT5: Efficient Text-To-Text Transformer for Long Sequences
LongT5 提出了一种可扩展的 Transformer 架构,通过同时增加输入序列长度和模型规模,在长上下文 NLP 任务中实现了性能提升。它采用了一种新颖的 TGlobal 注意力机制——在无需额外输入的情况下模仿 ETC 的局部/全局注意力机制——并结合 PEGASUS 风格的预训练方法,在 arXiv、PubMed 和 BigPatent 等摘要和问答基准测试中实现了最先进性能,支持高达 16k 的输入 token。
Recent work has shown that either (1) increasing the input length or (2) increasing model size can improve the performance of Transformer-based neural models. In this paper, we present a new model, called LongT5, with which we explore the effects of scaling both the input length and model size at the same time. Specifically, we integrated attention ideas from long-input transformers (ETC), and adopted pre-training strategies from summarization pre-training (PEGASUS) into the scalable T5 architecture. The result is a new attention mechanism we call {\em Transient Global} (TGlobal), which mimics ETC's local/global attention mechanism, but without requiring additional side-inputs. We are able to achieve state-of-the-art results on several summarization tasks and outperform the original T5 models on question answering tasks.
研究动机与目标
- 探索在 Transformer 模型中同时扩展输入长度和模型规模所带来的性能增益。
- 通过引入一种高效的注意力机制,解决长序列中完整自注意力机制带来的二次方计算成本问题。
- 将 PEGASUS 风格的预训练方法适配于抽象式摘要任务,以提升在多样化长序列任务上的表现。
- 在无需架构大改或额外输入的前提下,实现长文档的可扩展、高性能文本到文本建模。
- 开源模型架构、训练代码和预训练检查点,供社区使用。
提出的方法
- 提出 TGlobal 注意力,作为标准自注意力的即插即用替代方案,能够从输入 token 分组中实时合成全局 token,实现在无需外部输入的情况下实现局部稀疏性。
- 将 PEGASUS 预训练目标进行适配——对关键句子进行掩码,并要求自回归生成被掩码的片段——以提升在长上下文任务中的表现。
- 仅在编码器中引入 TGlobal 注意力,扩展 T5 架构,同时保持与现有 T5 流水线和推理框架的兼容性。
- 采用两阶段训练策略:首先在长文档上使用片段损坏和关键句子生成进行预训练,随后在下游任务上进行微调。
- 同时扩展模型规模和输入长度,在内存限制下推动可行性的边界。
- 采用分层注意力设计,其中局部注意力将计算限制在相邻 token 上,而全局 token 则支持长距离依赖建模。
实验结果
研究问题
- RQ1同时扩展输入长度和模型规模是否能在长上下文 NLP 任务中带来显著的性能提升?
- RQ2在长序列上,TGlobal 注意力与完整自注意力及其他稀疏注意力机制相比,在性能和效率方面表现如何?
- RQ3PEGASUS 风格的预训练是否能超越摘要任务,在长上下文任务中提升泛化能力?
- RQ4在长上下文建模中,模型规模、输入长度和计算成本之间的权衡关系是什么?
- RQ5在不进行架构修改的前提下,改进后的 T5 模型能否在长序列摘要和问答基准测试中达到最先进水平?
主要发现
- 在 arXiv 摘要数据集上,LongT5 达到了最先进 ROUGE 分数,在 16k 输入长度下 R-L 的 F1 得分为 44.03,优于所有基线模型。
- 在 PubMed 摘要任务中,LongT5 在 16k 输入长度下达到 46.56 的 R-L F1 分数,比之前最佳模型 PSG 高出 1.53 分。
- 消融实验表明,PEGASUS 风格预训练(PSG)在 arXiv 和 PubMed 数据集上均比片段损坏方法(SC)高出 1.2–1.5 个 ROUGE 分数。
- TGlobal 注意力使 LongT5 能够在仅带来轻微性能损失的情况下扩展至 16k 输入长度,同时保持了二次方复杂度的降低。
- LongT5 在 BigPatent、MediaSum 和 TriviaQA 上也实现了 SOTA 结果,证明其在摘要任务之外具有广泛适用性。
- 即使在长序列上进行微调,模型仍保持强劲性能,证实了联合扩展策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。