[论文解读] Leveraging Locality in Abstractive Text Summarization
本文提出 PageSum,一种基于局部性的摘要生成模型,通过空间、话语或文档级局部性将长文档划分为非重叠的页面,实现在每页内高效全注意力建模。该模型在保持高效注意力的同时,取得了与强基线模型相当的 ROUGE 分数,证明了基于局部性的归纳偏置在长文本摘要中可优于记忆效率的注意力近似方法。
Neural attention models have achieved significant improvements on many natural language processing tasks. However, the quadratic memory complexity of the self-attention module with respect to the input length hinders their applications in long text summarization. Instead of designing more efficient attention modules, we approach this problem by investigating if models with a restricted context can have competitive performance compared with the memory-efficient attention models that maintain a global context by treating the input as a single sequence. Our model is applied to individual pages which contain parts of inputs grouped by the principle of locality during both encoding and decoding. We empirically investigated three kinds of locality in text summarization at different levels of granularity, ranging from sentences to documents. Our experimental results show that our model has a better performance compared with strong baselines with efficient attention modules, and our analysis provides further insights into our locality-aware modeling strategy.
研究动机与目标
- 探究受限上下文的模型是否能在长文本摘要中达到或超越记忆效率注意力模型的性能。
- 评估空间、话语和文档级局部性作为摘要中归纳偏置的有效性。
- 通过在编码和解码中利用局部性,降低自注意力机制的二次方内存复杂度,同时不损失性能。
- 证明在基于局部性的框架中可保留全注意力机制,同时保持与 BART 等预训练模型的兼容性。
- 提供实证证据表明,基于局部性的建模可作为高效注意力近似方法的可行替代方案。
提出的方法
- 根据局部性原则将输入文档划分为非重叠的页面:按顺序邻近性(空间)、章节边界(话语)或聚类中的独立文档(文档级)。
- 使用全注意力 Transformer 编码器独立编码每一页,保留 BART 等模型的原始注意力机制。
- 解码器为每一页生成局部摘要,输出局部预测及其置信度分数。
- 最终摘要通过加权组合各局部预测生成,置信度分数用于优先选择更可靠的输出。
- 编码和解码过程中均不引入跨页注意力,严格实施局部性归纳偏置。
- 评估三种局部性类型:句子级空间局部性、章节级话语局部性,以及多文档设置下的文档级局部性。
实验结果
研究问题
- RQ1基于局部性的建模策略是否能在受限上下文下实现与高效注意力模型相当的性能?
- RQ2在不同摘要任务中,空间、话语或文档级局部性哪种类型表现最佳?
- RQ3在局部页面内保留全注意力机制是否优于维持全局上下文的高效注意力近似方法?
- RQ4当依赖关系跨越长距离的句子(即相距较远)时,基于局部性的模型性能如何受影响?
- RQ5现实文档中固有的空间局部性在多大程度上支持基于页面的摘要框架设计?
主要发现
- PageSum 在 arXiv 和 GovReport 数据集上均优于强基线的高效注意力模块,取得了具有竞争力或更优的 ROUGE 分数。
- 在 arXiv 数据集上,由于空间局部性较强,PageSum 表现更优,ROUGE-L F1 得分为 42.1,优于 Longformer 和 BigBird。
- 在 GovReport 数据集上,PageSum 取得 ROUGE-L F1 为 38.5,尽管空间局部性较弱,仍表现出强劲性能。
- 当两个相互依赖的句子相距较远时,模型无法捕捉长距离依赖关系,案例研究显示仅捕获了两个贡献句中的一个。
- 尽管存在此局限,长距离依赖在实际中较为罕见——arXiv 数据集中仅有 1.8% 的相互依赖句对的距离比率超过 0.5。
- 结果表明,高效注意力模型可能并未完全实现其设计目标以捕捉全局依赖关系,因为基于局部性的全注意力模型在每页内表现可与之媲美甚至更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。