[论文解读] Global-to-Local Neural Networks for Document-Level Relation Extraction
本文提出 GLRE,一种用于文档级关系抽取的全局到局部神经网络,通过异质图上的 R-GCN 整合实体全局表征(全局语义交互),通过多头注意力机制对实体提及进行建模以获取局部表征,并通过自注意力机制对其他关系进行建模以捕获上下文关系表征。该模型在长距离关系和多提及关系上表现尤为出色,在 CDR 和 DocRED 数据集上均超越了先前方法,达到当前最优性能。
Relation extraction (RE) aims to identify the semantic relations between named entities in text. Recent years have witnessed it raised to the document level, which requires complex reasoning with entities and mentions throughout an entire document. In this paper, we propose a novel model to document-level RE, by encoding the document information in terms of entity global and local representations as well as context relation representations. Entity global representations model the semantic information of all entities in the document, entity local representations aggregate the contextual information of multiple mentions of specific entities, and context relation representations encode the topic information of other relations. Experimental results demonstrate that our model achieves superior performance on two public datasets for document-level RE. It is particularly effective in extracting relations between entities of long distance and having multiple mentions.
研究动机与目标
- 解决现有文档级关系抽取模型在处理长距离复杂推理和多提及关系时的局限性。
- 通过联合建模全局文档语义、细粒度实体上下文和主题级别关系上下文,提升关系抽取性能。
- 克服先前基于图模型中对所有文档信息无差别整合所引入的噪声问题。
- 构建一个统一框架,融合粗粒度与细粒度的实体表征,并结合上下文关系信号。
提出的方法
- 模型使用启发式规则构建异质图,将文档中的提及、实体和句子关联起来。
- 通过在异质图上应用 R-GCN 学习实体的全局表征,以捕获全文档范围的语义交互。
- 通过在同一个实体的多个提及上应用多头注意力机制生成实体的局部表征,以聚合上下文信息。
- 通过在文档中所有其他关系上应用自注意力机制,建模上下文关系表征,以编码主题级别上下文。
- 通过分类头融合全局、局部和上下文关系表征,最终完成关系预测。
- 模型利用预训练的 BERT 获取初始 token 表征,并在 CDR 和 DocRED 数据集上进行评估。
实验结果
研究问题
- RQ1全局到局部表征学习框架是否能提升文档级关系抽取性能,特别是在长距离和多提及关系上?
- RQ2在异质图上使用 R-GCN 能在多大程度上建模实体与句子之间的复杂语义交互?
- RQ3通过自注意力机制引入上下文关系表征,能在多大程度上提升关系预测的准确性?
- RQ4将全局与局部实体表征相结合的方式,与仅使用单一层次表征的模型相比,性能如何?
- RQ5预训练语言模型(如 BERT、XLNet)对所提出的 GLRE 框架性能有何影响?
主要发现
- GLRE 在 CDR 和 DocRED 两个数据集上均达到当前最优性能,使用 BERT-Base 时在 CDR 上 F1 得分为 68.5,在 DocRED 上为 58.9。
- 在 DocRED 数据集上,使用 XLNet-Large 将 Ign F1 和 F1 分数分别提升至 58.5 和 60.5(在 'train + dev' 设置下)。
- 该模型在长跨度实体间关系抽取方面表现尤为突出,显著优于先前模型。
- 错误分析显示,40.9% 的失败案例源于涉及桥接实体的逻辑推理错误,表明在复杂推理方面仍有改进空间。
- 组件缺失错误(28.8%)和共指推理错误(12.9%)也较为显著,凸显了不完整或模糊句式结构带来的挑战。
- 模型性能对先验知识较为敏感,如案例 3 所示,缺乏外部知识即使架构正确仍会导致关系遗漏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。