[论文解读] Cross-Document Language Modeling.
本文提出跨文档语言建模(CD-LM),一种预训练方法,通过使用跨文档掩码和一种新型长上下文注意力模式(支持序列级全局注意力),增强了多文档自然语言处理任务中的掩码语言建模。CD-LM 在核心指代消解和抄袭检测等任务上取得了最先进性能,且参数量显著少于先前方法。
We introduce a new pretraining approach for language models that are geared to support multi-document NLP tasks. Our cross-document language model (CD-LM) improves masked language modeling for these tasks with two key ideas. First, we pretrain with multiple related documents in a single input, via cross-document masking, which encourages the model to learn cross-document and long-range relationships. Second, extending the recent Longformer model, we pretrain with long contexts of several thousand tokens and introduce a new attention pattern that uses sequence-level global attention to predict masked tokens, while retaining the familiar local attention elsewhere. We show that our CD-LM sets new state-of-the-art results for several multi-text tasks, including cross-document event and entity coreference resolution, paper citation recommendation, and documents plagiarism detection, while using a significantly reduced number of training parameters relative to prior works.
研究动机与目标
- 通过捕捉长距离依赖和跨文档依赖关系,提升多文档自然语言处理任务中的掩码语言建模性能。
- 与先前方法相比,减少实现有效多文档建模所需的训练参数数量。
- 在 Longformer 架构基础上引入一种新型注意力模式,支持序列级全局注意力,以实现更好的上下文建模。
- 提升下游多文档任务(如核心指代消解和引用推荐)的性能。
提出的方法
- 在单个输入序列中对多个相关文档进行预训练,通过跨文档掩码学习文档间的关联关系。
- 采用改进的 Longformer 注意力机制,结合序列级全局注意力,以在长上下文中预测被掩码的标记。
- 在局部窗口内应用局部注意力,同时在整个序列上保持全局注意力,以保留长距离依赖关系。
- 使用掩码语言建模目标,在大规模多文档语料库上端到端训练模型。
- 通过新型注意力模式优化模型,实现计算效率与长上下文建模之间的平衡。
- 在特定的多文档下游任务上对预训练的 CD-LM 进行微调,以评估其性能。
实验结果
研究问题
- RQ1跨文档掩码能否提升多文档自然语言处理任务中的掩码语言建模性能?
- RQ2在长上下文建模中引入序列级全局注意力,如何提升多文档任务的性能?
- RQ3CD-LM 在保持或超越先前方法性能的前提下,能在多大程度上减少参数量?
- RQ4多文档预训练与长上下文注意力的结合,是否能提升核心指代消解和抄袭检测任务上的泛化能力?
主要发现
- CD-LM 在跨文档事件和实体核心指代消解任务上取得了最先进性能。
- 该模型在论文引用推荐任务上优于先前方法,表现出更优的相关性预测能力。
- CD-LM 在文档抄袭检测任务中表现优异,表明其能有效建模跨文档语义相似性。
- 与先前方法相比,CD-LM 使用了显著更少的训练参数,同时保持或超越了性能表现。
- 跨文档掩码与序列级全局注意力的结合,显著提升了长距离依赖学习能力。
- 消融实验证实,跨文档掩码和新型注意力模式均对性能提升有独立贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。