Skip to main content
QUICK REVIEW

[论文解读] Adapting Pretrained Text-to-Text Models for Long Text Sequences

Wenhan Xiong, Anchit Gupta|arXiv (Cornell University)|Sep 21, 2022
Topic Modeling被引用 5
一句话总结

本文提出了一种将如 BART 等预训练文本到文本模型适配长上下文任务的方案,通过引入池化增强的块状注意力机制、在 CommonCrawl 的随机拼接短文档上进行预训练,以及使用可变长度跨度的掩码跨度预测目标。该模型在五个长文本摘要基准上达到最先进性能,在长上下文问答任务上也取得具有竞争力的结果,优于更大参数量的模型。

ABSTRACT

We present an empirical study of adapting an existing pretrained text-to-text model for long-sequence inputs. Through a comprehensive study along three axes of the pretraining pipeline -- model architecture, optimization objective, and pretraining corpus, we propose an effective recipe to build long-context models from existing short-context models. Specifically, we replace the full attention in transformers with pooling-augmented blockwise attention, and pretrain the model with a masked-span prediction task with spans of varying length. In terms of the pretraining corpus, we find that using randomly concatenated short-documents from a large open-domain corpus results in better performance than using existing long document corpora which are typically limited in their domain coverage. With these findings, we build a long-context model that achieves competitive performance on long-text QA tasks and establishes the new state of the art on five long-text summarization datasets, often outperforming previous methods with larger model sizes. Our code has been released at https://github.com/facebookresearch/bart_ls.

研究动机与目标

  • 开发一种有效且高效的方法,将现有短上下文预训练模型适配至长序列 NLP 任务。
  • 研究模型架构、预训练语料库和优化目标对长上下文性能的影响。
  • 确定基于开放域语料库生成的合成长文档是否在预训练中优于真实长文档集合。
  • 评估不同预训练目标在长上下文学习中的有效性。
  • 构建一个强大且高效的长上下文模型,使其在下游任务中表现达到或超过更大的模型。

提出的方法

  • 用池化增强的块状注意力替代 Transformer 中的标准全连接自注意力机制,以降低二次方复杂度并支持长序列处理。
  • 通过从 CommonCrawl 语料库(C4)中随机拼接短文档,构建伪长文档,形成大规模且多样化的预训练语料库。
  • 采用包含不同长度跨度的掩码跨度预测目标进行模型预训练,提升在不同序列长度下的泛化能力。
  • 在编码器中集成全局 token 和池化层,以增强长距离依赖建模能力,同时不改变基础模型的参数化结构。
  • 复用现有的短上下文模型权重,并通过进一步预训练进行微调,避免从头开始训练。
  • 采用标准的文本到文本框架,使模型可直接迁移至摘要生成和问答等下游任务。

实验结果

研究问题

  • RQ1池化增强的块状注意力是否在长上下文任务中优于其他长距离注意力机制?
  • RQ2在大型开放域语料库中随机拼接的短文档上进行预训练,是否比使用现有长文档语料库更有效?
  • RQ3在长上下文任务中,哪种预训练目标——掩码跨度预测、主句预测或基于模型的跨度预测——表现最佳?
  • RQ4能否通过从短上下文预训练模型适配,实现长文本摘要任务的最先进结果,而无需从头训练?
  • RQ5架构、语料库和优化目标对长上下文模型性能的相对贡献是什么?

主要发现

  • 池化增强的块状注意力在多个长上下文任务中显著优于其他长距离注意力机制,如全局 token 和滑动窗口注意力。
  • 尽管后者具有领域特定性,但在 C4 中随机拼接的短文档上进行预训练,性能仍优于使用书籍等精选长文档语料库。
  • 采用可变长度跨度的掩码跨度预测目标在短输出和长输出任务中均取得最佳平衡性能,优于其他优化目标。
  • 该适配模型在五个长文本摘要基准上达到新的最先进结果,其中在三个数据集上的 ROUGE-2 相对提升超过 10%。
  • 尽管参数量相对较小,该模型在长上下文问答任务中仍优于更大参数量的模型,证明了该适配方案的有效性。
  • 该模型在多种下游任务中表现一致提升,验证了所提出的预训练方案具有广泛有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。