Skip to main content
QUICK REVIEW

[论文解读] Information Extraction of Clinical Trial Eligibility Criteria

Yitong Tseo, M. I. Salkola|arXiv (Cornell University)|Jun 12, 2020
Topic Modeling参考文献 21被引用 5
一句话总结

本论文提出了一种新颖的知识库构建框架,用于从 ClinicalTrials.gov 的非结构化文本中提取并定位临床试验纳入标准。该框架结合了基于注意力机制的 BiLSTM-CRF 模型进行细粒度命名实体识别(F1=0.802)以及基于 word2vec 嵌入聚类的实体链接(准确率=0.485),实现了 75.3% 的端到端准确率,优于先前系统(如 Criteria2Query)在关键模块中的表现,并建立了一个具有竞争力的开源流水线。

ABSTRACT

Clinical trials predicate subject eligibility on a diversity of criteria ranging from patient demographics to food allergies. Trials post their requirements as semantically complex, unstructured free-text. Formalizing trial criteria to a computer-interpretable syntax would facilitate eligibility determination. In this paper, we investigate an information extraction (IE) approach for grounding criteria from trials in ClinicalTrials(dot)gov to a shared knowledge base. We frame the problem as a novel knowledge base population task, and implement a solution combining machine learning and context free grammar. To our knowledge, this work is the first criteria extraction system to apply attention-based conditional random field architecture for named entity recognition (NER), and word2vec embedding clustering for named entity linking (NEL). We release the resources and core components of our system on GitHub at https://github.com/facebookresearch/Clinical-Trial-Parser. Finally, we report our per module and end to end performances; we conclude that our system is competitive with Criteria2Query, which we view as the current state-of-the-art in criteria extraction.

研究动机与目标

  • 为解决临床试验中招募率低和人群多样性不足的问题,通过自动化方式从非结构化文本中提取纳入标准。
  • 将临床试验纳入标准提取形式化为知识库构建任务,实现对复杂自由文本标准的机器可读表示。
  • 通过引入基于注意力机制的深度学习与自监督嵌入聚类,提升临床试验标准中实体识别与链接的性能。
  • 开发一个具有竞争力的开源系统,在命名实体识别(NER)与命名实体链接(NEL)等关键模块中超越现有最先进方法。
  • 发布一个大规模、人工标注的数据集,包含 121,221 个临床实体、属性与限制条件,以支持研究的可复现性与基准测试。

提出的方法

  • 该系统将纳入标准提取视为知识库构建任务,将其分解为两个模块:命名实体识别(NER)与基于上下文无关语法(CFG)的属性及约束提取。
  • 采用基于注意力机制的 BiLSTM-CRF 架构进行细粒度 NER,检测 10 种实体类别(如治疗、慢性病、过敏等),并利用注意力机制提升上下文理解能力。
  • 对于命名实体链接(NEL),使用在试验描述上训练的 word2vec 嵌入进行聚类,并映射到知识库,实现无需人工概念集的自监督定位。
  • 使用 CFG 引擎联合执行属性识别、链接与约束提取(如 >18 岁,<25 kg/m²),通过句法规则解析复杂标准。
  • 设计了一个基于规则的否定检测模块,通过识别否定词(如“not”、“no”)来识别排除标准,准确率达 83.8%。
  • 该流水线在 85 个黄金标准试验上进行端到端评估,性能由医学专业人员进行评判。

实验结果

研究问题

  • RQ1与传统 CRF 模型相比,基于注意力机制的神经网络架构是否能提升临床试验纳入标准中细粒度命名实体识别的性能?
  • RQ2在临床试验标准的实体链接任务中,自监督的 word2vec 嵌入聚类是否优于基于规则或概念集驱动的方法?
  • RQ3上下文无关语法(CFG)引擎在从语义复杂、自由文本的纳入标准中准确提取与解析属性约束方面,表现如何?
  • RQ4与当前最先进系统 Criteria2Query 相比,该系统的整体端到端标准提取准确率如何?
  • RQ5实体链接的主要瓶颈是什么?通过扩展底层知识库并引入更具体的临床本体,能否有效缓解这些瓶颈?

主要发现

  • 所提出的基于注意力机制的 BiLSTM-CRF 模型在 10 个类别上的细粒度实体识别中取得 F1 得分为 0.802,优于 Criteria2Query 中的通用 NER 模型(F1=0.804),同时捕获了更多细粒度的实体类型。
  • 基于 word2vec 嵌入聚类的 NEL 方法准确率达 0.485,略高于 Criteria2Query 的 NEL(0.447),但仍有 41.6% 的有效提取未能成功定位。
  • 基于 CFG 的属性与约束提取在黄金标准集上达到 93.8% 的精确率(15/16),推断链接准确率达 75.0%(15/20),表明在结构化属性提取方面表现强劲。
  • 否定检测模块准确率达 83.8%(57/68),有效处理了排除标准,而这一功能在 Criteria2Query 的框架中并未实现。
  • 端到端系统在黄金标准集上达到 75.3% 的准确率(64/85),表现与 Criteria2Query(当前最先进水平)相当,具备竞争力。
  • 作者发布了包含 121,221 个实体、属性与限制条件的大型人工标注数据集,连同训练数据、模型与代码一并开源至 GitHub,支持研究可复现性与未来基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。