[论文解读] Deeper Clinical Document Understanding Using Relation Extraction
本文提出了一种可扩展的临床关系抽取(RE)框架,采用两种新型架构:一种是速度优化的全连接神经网络(FCNN),另一种是准确率优化的BioBERT模型。该框架在五个基准数据集上实现了最先进(SOTA)的F1分数,包括在i2b2 2012时序关系数据集上达到73.6,以及在n2c2定位学关系数据集上达到96.7,并支持实际应用,如生物医学知识图谱构建和通过增强的实体片段实现更精准的临床编码。
The surging amount of biomedical literature & digital clinical records presents a growing need for text mining techniques that can not only identify but also semantically relate entities in unstructured data. In this paper we propose a text mining framework comprising of Named Entity Recognition (NER) and Relation Extraction (RE) models, which expands on previous work in three main ways. First, we introduce two new RE model architectures -- an accuracy-optimized one based on BioBERT and a speed-optimized one utilizing crafted features over a Fully Connected Neural Network (FCNN). Second, we evaluate both models on public benchmark datasets and obtain new state-of-the-art F1 scores on the 2012 i2b2 Clinical Temporal Relations challenge (F1 of 73.6, +1.2% over the previous SOTA), the 2010 i2b2 Clinical Relations challenge (F1 of 69.1, +1.2%), the 2019 Phenotype-Gene Relations dataset (F1 of 87.9, +8.5%), the 2012 Adverse Drug Events Drug-Reaction dataset (F1 of 90.0, +6.3%), and the 2018 n2c2 Posology Relations dataset (F1 of 96.7, +0.6%). Third, we show two practical applications of this framework -- for building a biomedical knowledge graph and for improving the accuracy of mapping entities to clinical codes. The system is built using the Spark NLP library which provides a production-grade, natively scalable, hardware-optimized, trainable & tunable NLP framework.
研究动机与目标
- 为应对非结构化临床文本和生物医学文献中语义关系抽取日益增长的需求。
- 开发可扩展、可投入生产的RE模型,实现在真实临床数据处理中速度与准确率的平衡。
- 通过在实体跨度中融入上下文关系,提升临床编码的准确性。
- 支持实际应用,如患者时间线生成和生物医学知识图谱构建。
- 展示关系抽取在提升SNOMED、CPT和ICD-10编码实体解析方面的有效性。
提出的方法
- RE框架首先使用命名实体识别(NER)识别实体片段,随后对实体对进行关系分类。
- FCNN模型使用手工设计的特征,包括语义相似度、句法距离、依存句法分析以及每个实体周围100个词的上下文嵌入。
- 将特征拼接后输入全连接层,激活函数采用Leaky ReLU并应用批量归一化,最终通过使用交叉熵损失的Softmax层输出。
- BioBERT模型利用预训练BioBERT的迁移学习能力,端到端微调用于临床文本的关系分类。
- 两种模型均在Apache Spark NLP中实现,以支持硬件优化的可扩展推理,适用于大规模临床数据集。
- 系统支持多分类关系分类,并在公开基准数据集上进行训练,跨多个数据集进行超参数调优。
实验结果
研究问题
- RQ1轻量级FCNN-based RE模型是否能在显著降低内存占用和推理时间的前提下,实现与基于Transformer的模型相当的性能?
- RQ2在临床文本中,引入依存结构和语义相似度等上下文特征在多大程度上能提升关系分类性能?
- RQ3所提出的RE框架是否能在多样化的临床关系抽取基准上实现最先进性能?
- RQ4关系增强的实体片段提取在多大程度上能提升映射到SNOMED、CPT和ICD-10等临床编码系统时的准确性?
- RQ5该框架是否能有效用于从非结构化临床笔记中构建患者时间线和生物医学知识图谱?
主要发现
- 基于BioBERT的RE模型在2012年i2b2临床时序关系基准上实现了新的SOTA F1分数73.6,较之前SOTA提升1.2%。
- FCNN模型在2010年i2b2临床关系数据集上达到F1分数69.1,较之前SOTA提升1.2%。
- 在2019年表型-基因关系数据集中,BioBERT模型达到F1分数87.9,较之前最佳结果提升8.5%。
- 在2012年不良药物反应-药物反应数据集中,模型达到F1分数90.0,较之前SOTA提升6.3%。
- 在2018年n2c2定位学关系数据集中,模型达到F1分数96.7,较之前最佳模型提升0.6%。
- 增强的实体片段(如'CT扫描胸部(多切片)对比')相比基础片段(如'CT扫描'),在CPT/SNOMED编码中实现了显著更高的准确性(例如71260 vs. 3324F)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。