[论文解读] Relation Mention Extraction from Noisy Data with Hierarchical Reinforcement Learning
该论文提出了一种分层强化学习(HRL)模型,用于在弱监督设置下从噪声句子中提取关系提及,其中句子和提及短语均无显式标注。该模型使用顶层句子选择器过滤掉不相关的句子,使用底层提及提取器识别具有代表性的短语,通过奖励估计算法提供延迟奖励的间接监督,从而在干净数据和噪声数据上均实现了最先进性能。
In this paper we address a task of relation mention extraction from noisy data: extracting representative phrases for a particular relation from noisy sentences that are collected via distant supervision. Despite its significance and value in many downstream applications, this task is less studied on noisy data. The major challenges exists in 1) the lack of annotation on mention phrases, and more severely, 2) handling noisy sentences which do not express a relation at all. To address the two challenges, we formulate the task as a semi-Markov decision process and propose a novel hierarchical reinforcement learning model. Our model consists of a top-level sentence selector to remove noisy sentences, a low-level mention extractor to extract relation mentions, and a reward estimator to provide signals to guide data denoising and mention extraction without explicit annotations. Experimental results show that our model is effective to extract relation mentions from noisy data.
研究动机与目标
- 解决通过远程监督生成的噪声句子中提取具有代表性的关系提及的挑战。
- 克服大规模关系抽取中句子相关性与提及短语识别缺乏显式标注的问题。
- 开发一种弱监督方法,通过间接的延迟奖励而非真实标签进行学习。
- 提升下游自然语言处理任务(如关系分类和问答系统)中关系提及的质量与可解释性。
提出的方法
- 该模型采用分层强化学习框架,顶层智能体从一组噪声句子中选择相关句子。
- 底层智能体在选定的句子上执行提及提取,识别表达特定关系的短语。
- 奖励估计算法基于正确关系分类的可能性计算延迟奖励,为两个智能体提供间接监督。
- 两级策略学习均受奖励信号引导,实现句子去噪与提及提取的联合优化。
- 该框架被建模为半马尔可夫决策过程,以描述对句子和短语选择的序列决策过程。
- 模型采用策略梯度方法进行端到端训练,无需对句子或提及词进行人工标注。
实验结果
研究问题
- RQ1弱监督模型能否在无显式标注的情况下,有效从噪声句子中提取有意义的关系提及?
- RQ2分层强化学习架构如何在弱监督下联合优化句子过滤与提及提取?
- RQ3所提出的 HRL 模型在从噪声数据中提取具有代表性的关系提及方面,相较于现有基线模型表现如何?
- RQ4所提取的关系提及能否提升下游关系分类任务的性能?
主要发现
- 在干净数据上,HRL 模型在前 5 个提取提及中的 Precision@K 超过 0.8,显著优于 StanfordIE 和 ATT。
- 在噪声数据上,HRL 保持了强劲性能,P@10 达到 0.68,显著优于基线模型,后者性能急剧下降。
- HRL 模型优于单层强化学习模型,证明了分层设计在处理噪声数据中的有效性。
- 句子选择器组件有效过滤了无关句子,这从噪声数据上性能的提升中得到验证。
- 所提取的关系提及显著提升了下游关系分类性能,当作为额外特征输入卷积神经网络分类器时,宏平均 F1 达到 82.13。
- 该模型在无显式标注的情况下,通过学习延迟奖励,证明了其在大规模弱监督关系提及抽取任务中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。