Skip to main content
QUICK REVIEW

[论文解读] A Relation Extraction Approach for Clinical Decision Support

Maristella Agosti, Giorgio Maria Di Nunzio|arXiv (Cornell University)|May 3, 2019
Biomedical Text Mining and Ontologies参考文献 22被引用 3
一句话总结

本文提出将通过基于规则和基于学习的方法提取的医学概念之间的语义关系,用作临床决策支持系统中的索引和检索特征。实验表明,在特定查询下,基于关系的检索显著提升了精度,当关系具有信息量时,平均nDCG提升达20%;然而,由于查询长度和结构不匹配,性能表现不一致。

ABSTRACT

In this paper, we investigate how semantic relations between concepts extracted from medical documents can be employed to improve the retrieval of medical literature. Semantic relations explicitly represent relatedness between concepts and carry high informative power that can be leveraged to improve the effectiveness of retrieval functionalities of clinical decision support systems. We present preliminary results and show how relations are able to provide a sizable increase of the precision for several topics, albeit having no impact on others. We then discuss some future directions to minimize the impact of negative results while maximizing the impact of good results.

研究动机与目标

  • 探究医学概念之间的语义关系是否能提升临床决策支持系统中的检索效果。
  • 比较基于规则和基于学习的关系抽取方法在提升基于病例的医学文献检索精度方面的有效性。
  • 评估基于关系的索引对检索性能的影响,使用OHSUMED数据集进行评估。
  • 识别关系提升检索效果的条件,并解决其未能产生有用结果的情况。
  • 探索未来关系抽取方向,使其更契合临床环境中信息检索的需求。

提出的方法

  • 基于规则的方法在参考知识库中存在关系时,为同一句子内的概念对分配关系。
  • 基于学习的方法训练一个句子级关系抽取器,基于医学文本中的上下文线索推断关系。
  • 通过加权和计算段落级得分:$\text{score}(q,d) = \sum_{p\in d} \frac{|R_p \cap R_q|}{|R_q|} \cdot \text{BM25}(p,q)$。
  • 基于文档与查询之间共享的相关关系数量对文档进行评分,使用BM25进行段落检索。
  • 采用OHSUMED数据集上的nDCG评估性能,比较词袋(BoW)、词概念袋(BoC)和关系袋(BoR)表示方法。
  • 实验仅限于可提取关系的查询,重点关注相关性得分非零的案例。

实验结果

研究问题

  • RQ1从医学文档和查询中提取的语义关系是否能提升临床决策支持检索系统的精度?
  • RQ2基于规则和基于学习的关系抽取方法在临床信息检索中的有效性如何比较?
  • RQ3在何种条件下关系能显著提升检索性能,而在何种情况下会失效?
  • RQ4关系在基于病例的医学文献检索中,相对于传统基于概念或基于术语的检索,能多大程度上表现更优?
  • RQ5如何优化关系抽取以减少假阴性,并在低资源查询场景下提高一致性?

主要发现

  • 基于规则的方法成功从106个OHSUMED查询中的44个提取了关系,其中39个查询与文档中的关系匹配。
  • 对于关系提供非零结果的查询,与基于概念的检索相比,平均nDCG提升了20%,且该提升具有统计显著性。
  • 基于学习的方法仅从25个查询中提取了关系,其中12个查询与文档中的关系匹配,表明由于查询结构和句法不匹配,覆盖度较低。
  • 在关系具有信息量的情况下,其表现优于基线的基于术语的检索,但由于结果不一致,整体上关系与术语检索之间未发现显著差异。
  • nDCG得分的方差范围从0到1,突显了关系在正确提取时的高信息潜力,但也表明其对抽取质量与查询长度高度敏感。
  • 本研究发现,简短且非叙述性的查询限制了关系抽取,未来工作应聚焦于面向信息检索优化的关系抽取,以克服此类场景下的低召回率问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。