[论文解读] Improving Distantly Supervised Relation Extraction with Neural Noise Converter and Conditional Optimal Selector
本文提出了一种新型神经噪声转换器和条件最优选择器,通过减轻知识库中的噪声标签,提升远程监督关系抽取的性能。噪声转换器在logits空间上学习一个结构化的转移矩阵以校正误标数据,而条件选择器则在以负样本为主导的句子包中提升预测鲁棒性,在基准数据集上实现了最先进性能,相较于PCNN+ATT在mean P@N上提升了9.1个百分点。
Distant supervised relation extraction has been successfully applied to large corpus with thousands of relations. However, the inevitable wrong labeling problem by distant supervision will hurt the performance of relation extraction. In this paper, we propose a method with neural noise converter to alleviate the impact of noisy data, and a conditional optimal selector to make proper prediction. Our noise converter learns the structured transition matrix on logit level and captures the property of distant supervised relation extraction dataset. The conditional optimal selector on the other hand helps to make proper prediction decision of an entity pair even if the group of sentences is overwhelmed by no-relation sentences. We conduct experiments on a widely used dataset and the results show significant improvement over competitive baseline methods.
研究动机与目标
- 解决远程监督关系抽取中的固有噪声问题,其错误标注源于与知识库的启发式对齐。
- 在不依赖人工规则或预处理启发式方法的前提下,降低噪声训练实例的负面影响。
- 在句子组主要由无关系实例主导时,提升预测的可靠性,即使多数句子被错误标注。
- 开发一种可微分、端到端可训练的框架,通过结构化约束校正噪声标签并增强决策能力。
- 在标准基准数据集上,相对于强基线模型PCNN+ATT,持续实现性能提升。
提出的方法
- 提出一种在logits空间上运行的神经噪声转换器,学习噪声标签(来自KB)与真实标签之间的结构化转移矩阵,并基于远程监督数据集的特性施加约束。
- 引入一种条件最优选择器,通过考虑句子级别预测的分布,动态选择实体对的最可靠预测,尤其在组内被负样本主导时表现更优。
- 使用一种可微分损失函数,将噪声转换器的转移矩阵与最终预测头相结合,实现联合优化。
- 将噪声转换器作为可学习层置于模型logits之上,避免在训练过程中需将输出投影到有效概率分布。
- 实现一种条件选择机制,利用注意力加权的句子表示,并应用基于阈值的决策规则,根据置信度和一致性选择最优预测。
- 使用标准交叉熵损失端到端训练模型,其中噪声转换器学习将噪声标签映射为更准确的真实标签估计。
实验结果
研究问题
- RQ1在无需显式噪声检测的前提下,logits空间上的可学习转移矩阵能否有效校正远程监督关系抽取中的噪声标签?
- RQ2当句子组主要由负样本主导时,条件最优选择器在真实关系仅存在于少数句子中的情况下,如何提升预测性能?
- RQ3与假设至少有一条句子表达正确关系的基线方法相比,神经噪声转换器在多大程度上表现更优?
- RQ4当训练数据中存在来自知识库错对齐的高比例噪声时,所提方法是否仍保持鲁棒性和泛化能力?
- RQ5噪声转换器与条件选择器的结合是否能持续且显著地超越SOTA模型如PCNN+ATT?
主要发现
- 所提模型PCNN+nc+cond_opt的mean P@N达到81.3,较原始PCNN+ATT报告结果高出9.1个百分点,较作者自研的PCNN+ATT实现高出7.1个百分点。
- 单模型平均精确率为43.5%,集成模型为45.2%,分别优于PCNN+ATT的36.5%和37.9%。
- 消融实验表明,若移除神经噪声转换器(PCNN+I_W+cond_opt),性能显著下降,mean P@N降至78.8,证实其在标签校正中的关键作用。
- 条件最优选择器优于简单的平均加权选择器(PCNN+I_W+avg_weighted),后者仅实现75.2的mean P@N,表明其在处理不平衡句子组方面更具优势。
- 所提模型的集成版本进一步提升性能,集成模型达到45.2%的平均精确率,显著优于PCNN+ATT集成模型的37.9%。
- 图5和图4中的精确率/召回率曲线证实,无论在单模型还是集成设置下,所提模型在所有评估阈值下均保持一致的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。