[论文解读] Coarse-to-Fine Entity Representations for Document-level Relation Extraction
该论文提出CFER,一种用于文档级关系抽取的粗到细实体表示模型,首先通过密集连接图卷积网络(DCGCN)捕获全局上下文信息,然后利用注意力引导的路径编码来建模长距离实体交互。该方法在DocRED和CDR数据集上达到最先进性能,展现出对标签不平衡的鲁棒性以及对句子间关系的优越建模能力。
Document-level Relation Extraction (RE) requires extracting relations expressed within and across sentences. Recent works show that graph-based methods, usually constructing a document-level graph that captures document-aware interactions, can obtain useful entity representations thus helping tackle document-level RE. These methods either focus more on the entire graph, or pay more attention to a part of the graph, e.g., paths between the target entity pair. However, we find that document-level RE may benefit from focusing on both of them simultaneously. Therefore, to obtain more comprehensive entity representations, we propose the Coarse-to-Fine Entity Representation model (CFER) that adopts a coarse-to-fine strategy involving two phases. First, CFER uses graph neural networks to integrate global information in the entire graph at a coarse level. Next, CFER utilizes the global information as a guidance to selectively aggregate path information between the target entity pair at a fine level. In classification, we combine the entity representations from both two levels into more comprehensive representations for relation extraction. Experimental results on two document-level RE datasets, DocRED and CDR, show that CFER outperforms existing models and is robust to the uneven label distribution.
研究动机与目标
- 为解决现有基于图的模型在文档级关系抽取中的局限性,这些模型要么过度强调全局结构,要么过度关注局部路径。
- 同时捕获全局上下文信息,并对文档中目标实体之间的长距离交互进行建模。
- 提升在具有复杂句子间关系的长文档上的关系抽取性能。
- 增强对不均衡标签分布的鲁棒性,尤其是对长尾关系。
- 开发一个统一框架,有效整合全局与细粒度路径级表示。
提出的方法
- 构建一个包含五种边类型的文档级图:句法依存关系、相邻词、跨句子连接、共指链接和自环。
- 在粗粒度阶段应用密集连接图卷积网络(DCGCN),在全图范围内聚合全局上下文信息。
- 在细粒度阶段使用基于注意力的路径编码机制,该机制由粗粒度表示引导,以选择性地聚合目标实体对之间的路径信息。
- 将粗粒度的全局表示与细粒度的路径感知表示结合,生成用于关系分类的综合实体嵌入。
- 使用交叉熵损失在关系预测上端到端训练模型,注意力权重被学习以聚焦于信息量丰富的路径。
- 在最终分类器之前,通过拼接或逐元素组合的方式融合两个层次的表示。
实验结果
研究问题
- RQ1将全局图级上下文与定向路径级信息相结合,能否提升文档级关系抽取性能?
- RQ2与单阶段方法相比,粗到细策略是否能更好地建模长距离实体交互?
- RQ3在类别不平衡情况下,特别是对长尾关系,该方法表现如何?
- RQ4粗粒度表示能否有效引导细粒度路径聚合,从而避免次优注意力分配?
- RQ5该模型在标准基准测试上相较于现有基于图和非基于图的基线模型,性能提升程度如何?
主要发现
- CFER在DocRED开发集上取得56.40的F1分数,优于所有消融变体和现有模型。
- 消融研究显示,移除粗粒度DCGCN模块会使F1分数降低2.08点,凸显其重要性。
- 引入细粒度表示后,micro-F1提升4.12点,证实其在捕捉长距离关系方面的价值。
- CFER在长尾关系(距离[8, ∞))上表现出更强的性能增益,micro-F1达61.5,表明其对标签不平衡具有鲁棒性。
- 案例研究显示,CFER(完整版)在多个有用路径上学习到均衡的注意力权重,而消融模型因缺乏全局引导而聚焦于次优路径。
- 该模型成功抽取涉及跨句子推理的关系事实,例如P140关系,仅完整模型可恢复该关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。