Skip to main content
QUICK REVIEW

[论文解读] Negation Detection for Clinical Text Mining in Russian

Anastasia A. Funkner, Ksenia Balabaeva|arXiv (Cornell University)|Apr 10, 2020
Topic Modeling被引用 6
一句话总结

本文提出了一种无需语料库的基于梯度提升的俄语临床文本否定检测系统,旨在分类疾病是否被否定、未提及或存在。该系统在五种疾病上的平均F值介于0.81至0.93之间,并显著提升了对急性冠状动脉综合征患者手术情况的预测能力。

ABSTRACT

Developing predictive modeling in medicine requires additional features from unstructured clinical texts. In Russia, there are no instruments for natural language processing to cope with problems of medical records. This paper is devoted to a module of negation detection. The corpus-free machine learning method is based on gradient boosting classifier is used to detect whether a disease is denied, not mentioned or presented in the text. The detector classifies negations for five diseases and shows average F-score from 0.81 to 0.93. The benefits of negation detection have been demonstrated by predicting the presence of surgery for patients with the acute coronary syndrome.

研究动机与目标

  • 为解决处理非结构化俄语医疗记录的NLP工具缺乏的问题。
  • 开发一个否定检测模块,以识别临床文本中疾病是否被否认、不存在或存在。
  • 提出一种无需语料库的机器学习方法,适用于俄语等低资源临床语言环境。
  • 评估否定检测对预测急性冠状动脉综合征患者手术干预的影响。

提出的方法

  • 训练一个梯度提升分类器,将临床短语分类为三类:否定、未提及或存在。
  • 该方法依赖语言学和句法特征,无需人工标注的训练语料库。
  • 特征包括词级模式、依存句法解析线索以及与俄语否定相关的词形信息。
  • 模型在聚焦于五种特定疾病的临床文本数据集上进行训练和评估。
  • 该方法采用一对其余策略将二分类框架适配为三分类输出。
  • 通过标准指标(包括精确率、召回率和F值)评估模型性能。

实验结果

研究问题

  • RQ1无需语料库的机器学习方法能否有效检测俄语临床文本中的否定?
  • RQ2该模型在俄语医疗记录中对疾病状态(否定、未提及、存在)的分类准确度如何?
  • RQ3将否定检测纳入临床预测任务(如手术结果预测)能带来多大程度的改进?
  • RQ4该模型在俄语临床环境下的不同疾病上的表现如何?

主要发现

  • 该否定检测模型在五种目标疾病上的平均F值介于0.81至0.93之间。
  • 该系统能够有效区分俄语临床记录中被否定、未提及或存在的疾病状态。
  • 将否定检测纳入后,显著提升了对急性冠状动脉综合征患者手术干预的预测能力。
  • 该模型无需大规模人工标注的训练语料库即可有效运行,适用于低资源环境。
  • 在缺乏领域特定训练数据的情况下,梯度提升分类器优于基线方法。
  • 该方法在俄语多样的临床表达中表现出稳健性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。