Skip to main content
QUICK REVIEW

[论文解读] Efficient Long-Text Understanding with Short-Text Models

Maor Ivgi, Uri Shaham|arXiv (Cornell University)|Aug 1, 2022
Topic Modeling被引用 4
一句话总结

本文提出SLED,一种使现成的短文本预训练编码器-解码器模型(如BART、T5)能够通过将输入分割为重叠块、独立编码每一块,并利用预训练解码器融合表示,从而高效理解长文本的方法。SLED实现了具有竞争力的性能——在使用参数量最多小50倍的模型且无需额外预训练的情况下,性能与LongT5 base和UL2等专用长上下文模型相当或更优。

ABSTRACT

Transformer-based pretrained language models (LMs) are ubiquitous across natural language understanding, but cannot be applied to long sequences such as stories, scientific articles and long documents, due to their quadratic complexity. While a myriad of efficient transformer variants have been proposed, they are typically based on custom implementations that require expensive pretraining from scratch. In this work, we propose SLED: SLiding-Encoder and Decoder, a simple approach for processing long sequences that re-uses and leverages battle-tested short-text pretrained LMs. Specifically, we partition the input into overlapping chunks, encode each with a short-text LM encoder and use the pretrained decoder to fuse information across chunks (fusion-in-decoder). We illustrate through controlled experiments that SLED offers a viable strategy for long text understanding and evaluate our approach on SCROLLS, a benchmark with seven datasets across a wide range of language understanding tasks. We find that SLED is competitive with specialized models that are up to 50x larger and require a dedicated and expensive pretraining step.

研究动机与目标

  • 解决标准预训练语言模型在长序列上应用时面临的二次方计算复杂度限制问题。
  • 通过重用现有、现成的短文本模型,避免昂贵的专用长上下文模型定制预训练。
  • 开发一种简单、可泛化的框架,实现强大的长文本性能,无需架构修改或额外预训练。
  • 提供一种诊断工具,用于分析不同NLP基准对长距离依赖关系的需求。
  • 证明分块编码与解码器内融合在真实任务中可有效处理长距离推理。

提出的方法

  • 将长输入序列划分为固定长度的重叠块,以保持局部上下文的连续性。
  • 使用现成的编码器-解码器语言模型(如BART、T5)中的预训练编码器,独立编码每一块。
  • 将所有编码后的块表示输入到一个预训练解码器中,该解码器可关注所有块以实现跨块融合。
  • 利用解码器的自回归生成能力,基于融合后的表示生成最终输出,模仿解码器内融合(FiD)机制,但适配于长文档。
  • 独立地在每一块中利用主干模型的位置编码,使方法可推广至任意输入长度。
  • 通过使用重叠块并定义有效块标记,确保边缘标记的鲁棒性,以保留边界处的上下文信息。

实验结果

研究问题

  • RQ1一个简单、模块化的框架,通过重用现有短文本模型,是否能在无需专用预训练的情况下实现具有竞争力的长文本理解?
  • RQ2与专用长上下文架构相比,分块编码下的解码器内融合在长距离推理方面有多高效?
  • RQ3像SCROLLS这样的长文本基准在多大程度上依赖远程、非局部上下文?哪些任务需要更深层次的跨块推理?
  • RQ4SLED的性能如何随模型大小和输入长度变化?与最先进专用模型相比表现如何?
  • RQ5SLED能否作为诊断工具,用于分析不同NLP任务对长距离依赖关系的需求?

主要发现

  • SLED在多个任务上将预训练模型在SCROLLS基准上的平均得分提升了6分,证明其在长上下文基准上具有强大的泛化能力。
  • BART large - SLED的性能与LongT5 base相当,后者是专为长距离依赖关系预训练的模型,尽管参数量仅为后者的1/50。
  • 在SCROLLS基准上,SLED优于UL2(参数量大50倍)的性能,表明在有效重用架构的前提下,参数效率不会损害性能。
  • SLED在训练数据有限的数据集上表现尤为出色,显著优于LED,后者因在小规模长上下文数据集上泛化能力差而表现不佳。
  • 受控实验确认,SLED能够准确定位长序列中的相关信息,并有效融合独立编码块的信息。
  • 利用SLED的分析表明,SCROLLS中的问答(QA)与自然语言推理(NLI)任务对上下文的依赖相对局部,而摘要生成和部分NLI任务则更受益于长距离融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。