Skip to main content
QUICK REVIEW

[论文解读] Leveraging Dependency Forest for Neural Medical Relation Extraction

Linfeng Song, Yue Zhang|arXiv (Cornell University)|Nov 11, 2019
Topic Modeling参考文献 52被引用 6
一句话总结

本文提出利用依赖森林——即多个句法解析假设的集合——而非单一的1-best依赖树,以提升神经医学关系抽取性能。通过使用图神经网络编码依赖森林,并与关系抽取任务联合训练,模型能自动识别可靠的句法边,同时过滤解析噪声,在两个生物医学基准上取得最先进性能。

ABSTRACT

Medical relation extraction discovers relations between entity mentions in text, such as research articles. For this task, dependency syntax has been recognized as a crucial source of features. Yet in the medical domain, 1-best parse trees suffer from relatively low accuracies, diminishing their usefulness. We investigate a method to alleviate this problem by utilizing dependency forests. Forests contain many possible decisions and therefore have higher recall but more noise compared with 1-best outputs. A graph neural network is used to represent the forests, automatically distinguishing the useful syntactic information from parsing noise. Results on two biomedical benchmarks show that our method outperforms the standard tree-based methods, giving the state-of-the-art results in the literature.

研究动机与目标

  • 解决生物医学领域依赖解析准确率低的问题,该问题削弱了句法特征在关系抽取中的实用性。
  • 克服1-best依赖树的局限性,因其易受解析不准确导致的错误传播影响。
  • 探索依赖森林——包含多个候选句法结构——作为关系抽取中更鲁棒的句法信息来源的潜力。
  • 开发一种神经框架,联合学习从噪声依赖森林中提取有用的句法信号,同时最小化解析错误的影响。
  • 证明当依赖森林经过适当编码并端到端训练时,其在医学关系抽取中的性能优于标准树基方法。

提出的方法

  • 使用神经依赖解析器生成依赖森林,输出多个高置信度的解析假设(k-best或概率森林),以提高对标准金标弧的召回率。
  • 使用图神经网络(GNN)编码依赖森林,将森林视为异质图,其中节点为词语,边为带有相关置信度分数的句法弧。
  • 将GNN嵌入的森林表示作为外部特征集成到神经关系抽取模型中,支持通过GNN的反向传播进行端到端训练。
  • 采用可微分解码策略(如KBestEisnerPS或EdgewisePS)生成森林,以在保持计算可行性的同时保留结构多样性。
  • 端到端训练整个系统,使GNN能够学习哪些森林中的弧对关系预测最为相关,从而有效过滤低精度解析带来的噪声。
  • 在GNN中应用注意力机制或边级评分,动态加权消息传递过程中不同句法弧的重要性,提升对解析错误的鲁棒性。

实验结果

研究问题

  • RQ1与1-best依赖树相比,依赖森林是否能在存在解析错误的情况下提升医学关系抽取性能?
  • RQ2图神经网络在多大程度上能有效区分依赖森林中的有用句法信号与噪声?
  • RQ3通过GNN进行反向传播的端到端训练,是否能使模型学会优先选择高置信度的句法弧而非低置信度的弧?
  • RQ4不同的森林生成策略(如k-best与概率法)对最终关系抽取性能有何影响?
  • RQ5所提出的方法是否具有跨生物医学领域的泛化能力,如在新闻领域基准SemEval-2010上的表现所示?

主要发现

  • 所提方法在BioCreative VI ChemProt(CPR)基准上取得最先进F1分数,优于此前最佳模型1.1分(85.7 vs. 84.6 F1)。
  • 在表型-基因关系的PGR基准上,该方法显著优于强基线DepTree(78.9 F1),提升6.8分(85.7 F1),且自 resampling 检验中p < 0.01。
  • EdgewisePS森林生成策略始终优于KBestEisnerPS,在CPR和PGR上均取得最高F1,表明其在保留相关句法结构方面的有效性。
  • 案例研究显示,基于森林的模型能正确识别关键句法关系(如“STAT3”与“AKT”相连,而非“被抑制”),而1-best树因解析错误而遗漏这些关系。
  • 该方法在SemEval-2010任务8基准(新闻领域)上也表现更优,F1达86.3分,略高于先前最先进方法C-AGGCN(85.7 F1),证明其在生物医学领域之外也具备泛化能力。
  • 性能提升归因于森林对正确弧的更高召回率,使模型能从影响1-best树的域外解析错误中恢复。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。