[论文解读] Efficient Attentions for Long Document Summarization
本文提出Hepos,一种新颖的高效编码器-解码器注意力机制,通过使用头级别的位置步长来降低长文档摘要中的计算和内存开销。通过使模型能够处理超过10,000个标记——是之前模型的两倍以上——Hepos在GovReport和PubMed数据集上实现了最先进(SOTA)的ROUGE分数,并提升了忠实度,人工评估也证实其摘要更具信息量且更准确。
The quadratic computational and memory complexities of large Transformers have limited their scalability for long document summarization. In this paper, we propose Hepos, a novel efficient encoder-decoder attention with head-wise positional strides to effectively pinpoint salient information from the source. We further conduct a systematic study of existing efficient self-attentions. Combined with Hepos, we are able to process ten times more tokens than existing models that use full attentions. For evaluation, we present a new dataset, GovReport, with significantly longer documents and summaries. Results show that our models produce significantly higher ROUGE scores than competitive comparisons, including new state-of-the-art results on PubMed. Human evaluation also shows that our models generate more informative summaries with fewer unfaithful errors.
研究动机与目标
- 解决Transformer在长文档摘要中计算和内存复杂度呈二次方增长的问题。
- 克服现有高效自注意力方法无法扩展到生成式摘要中编码器-解码器注意力的局限性。
- 在不截断的情况下实现对长文档(如10K+标记)的端到端训练,以减少幻觉现象。
- 构建一个新的基准数据集GovReport,包含长文档(9,400字)和摘要(553字),以更好地评估长篇生成式摘要。
- 提出一种新的忠实度评估指标APES src,其与人类判断的相关性优于以往方法。
提出的方法
- 提出Hepos,一种多头注意力机制,其中每个注意力头在输入序列中以固定且交错的位置(位置步长)关注标记。
- 通过将每个头的键值注意力限制为稀疏且呈步长模式,将计算量减少至O(nw),同时每头仍保持全局上下文感知能力。
- 将Hepos与现有的稀疏编码器自注意力机制(如LSH、Sinkhorn)结合,实现输入长度的扩展,同时将内存占用控制在实际可接受范围内。
- 设计一种新的填空式问答评估指标APES src,通过基于参考的提问方式比较源文本和摘要中的答案,相较于严格匹配方式提升了词汇灵活性。
- 使用基于BART的架构,在新构建的GovReport数据集上训练和微调模型,且在编码器和解码器中均引入Hepos。
- 结合自动指标(ROUGE、FactCC、APES、APES src)与人工评估,综合评估摘要的质量与忠实度。
实验结果
研究问题
- RQ1高效的编码器-解码器注意力机制是否能够实现对长文档(如10K+标记)的无截断训练?
- RQ2在ROUGE性能和计算效率方面,Hepos与低秩投影及其他高效注意力机制相比表现如何?
- RQ3处理更长的输入序列是否能带来更具信息量和更高忠实度的摘要,依据自动评估和人工评估结果?
- RQ4像APES src这样的新忠实度指标是否能比现有指标(如APES或蕴含式评分器)更好地与人类判断相关联?
- RQ5与全注意力基线模型相比,Hepos在PubMed和GovReport上的长篇文档摘要质量提升程度如何?
主要发现
- Hepos使模型能够在同一块GPU上处理超过10,000个输入标记——远超全注意力模型5,000标记的限制。
- 在GovReport数据集上,基于Hepos的模型取得了59.6的ROUGE-L分数,显著优于低秩投影基线(59.0)和全注意力模型。
- 在PubMed数据集上,Hepos模型取得了新的最先进ROUGE-L分数73.3,超越了之前的SOTA模型。
- 人工评估显示,Hepos生成的摘要在信息量上高出21%,在不忠实度上低23%;APES src指标与人类判断的相关性最强(在PubMed上r = 0.32)。
- APES src指标在与人类评分的相关性上优于APES和FactCC,尤其在捕捉改写或缩写形式的引用(如“mortality”与“death rate”)方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。