[论文解读] Investigating Efficiently Extending Transformers for Long Input Summarization
该论文提出 PEGASUS-X,这是 PEGASUS 模型的一个 568M 参数扩展版本,通过使用带有学习全局 token 的交错块局部注意力机制,高效处理长达 16K 个 token 的长输入摘要任务。该模型在 GovReport 和 PubMed 数据集上实现了最先进性能,同时保持了强大的短输入性能,相较于 LongT5 等更大模型,仅增加极少参数且无需模型并行化。
While large pretrained Transformer models have proven highly capable at tackling natural language tasks, handling long sequence inputs continues to be a significant challenge. One such task is long input summarization, where inputs are longer than the maximum input context of most pretrained models. Through an extensive set of experiments, we investigate what model architectural changes and pretraining paradigms can most efficiently adapt a pretrained Transformer for long input summarization. We find that a staggered, block-local Transformer with global encoder tokens strikes a good balance of performance and efficiency, and that an additional pretraining phase on long sequences meaningfully improves downstream summarization performance. Based on our findings, we introduce PEGASUS-X, an extension of the PEGASUS model with additional long input pretraining to handle inputs of up to 16K tokens. PEGASUS-X achieves strong performance on long input summarization tasks comparable with much larger models while adding few additional parameters and not requiring model parallelism to train.
研究动机与目标
- 识别将短上下文预训练 Transformer 模型适配至长输入摘要任务的最有效架构与预训练修改方法。
- 评估在长序列建模中模型效率、内存使用与性能之间的权衡。
- 开发一种实用且低成本的方案,将现有小到中型模型扩展以处理长输入,而无需从头训练。
- 在最大化长输入摘要任务收益的同时,最小化对短输入性能的退化。
- 发布一个高性能、参数高效的长输入摘要模型,避免使用模型并行化。
提出的方法
- 采用带有交错块的块局部注意力机制,以降低内存和计算成本,同时保持长距离建模能力。
- 引入学习的全局 token 嵌入表示,以捕捉全局上下文信息,提升性能而不增加序列长度。
- 在从短序列预训练的 PEGASUS 模型初始化后,增加一个在长序列(最长达 16K token)上的额外预训练阶段。
- 使用正弦位置嵌入代替 T5 的相对位置偏差,以减少计算开销,同时保持性能。
- 通过消融实验优化编码器-解码器层分布与注意力超参数。
- 使用与原始 PEGASUS 模型相同的优化目标,在长输入摘要数据集上微调最终模型。
实验结果
研究问题
- RQ1哪些高效的 Transformer 架构变体在长输入摘要任务中能实现性能与计算效率的最佳平衡?
- RQ2与仅微调相比,在长序列上进行额外预训练是否能显著提升下游摘要性能?
- RQ3位置编码方案与全局 token 集成等架构选择如何影响性能与效率?
- RQ4一个小型、高效的模型是否能在不依赖模型并行化或大量参数的情况下实现长输入摘要任务的最先进结果?
- RQ5与直接微调相比,预先将短上下文模型适配为长上下文架构能在多大程度上提升性能?
主要发现
- 带有学习全局 token 的交错块局部 Transformer 在长输入摘要任务中实现了性能与效率的最佳权衡。
- 在从短序列预训练模型初始化后,进行长序列上的额外预训练,相比仅长序列预训练或无适配,能显著提升下游性能。
- PEGASUS-X 在 GovReport 和 PubMed 的长输入摘要基准测试中实现了最先进性能,尽管参数量少于 LongT5 等模型。
- 该模型在短输入摘要任务上表现出极小的性能退化,表明其在不同输入长度下具有强大的泛化能力。
- 正弦位置嵌入在速度方面优于 T5 的相对位置偏差,仅带来轻微性能下降,因此更适合高效推理。
- 所提出的方案——从短上下文模型初始化,应用架构修改,并增加长序列预训练——在将现有模型扩展至长上下文时被证明极为有效且可扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。