Skip to main content
QUICK REVIEW

[论文解读] Text Classification of Cancer Clinical Trial Eligibility Criteria

Yumeng Yang, Soumya Jayaraj|PubMed|Sep 14, 2023
Biomedical Text Mining and Ontologies参考文献 37被引用 7
一句话总结

本研究开发并评估了基于 BERT 的文本分类模型,以自动识别 764 项 III 期癌症试验的七种常见临床试验排除标准——既往恶性肿瘤、HIV、乙型/丙型肝炎、精神疾病、物质滥用和自身免疫性疾病,这些标准来自临床试验的入选标准。所提出的 ClinicalTrialBERT 模型在 50 万份试验入选说明上进行预训练,实现了最先进性能,证明了针对临床试验 NLP 任务进行领域特定预训练的可行性和有效性。

ABSTRACT

Automatic identification of clinical trials for which a patient is eligible is complicated by the fact that trial eligibility are stated in natural language. A potential solution to this problem is to employ text classification methods for common types of eligibility criteria. In this study, we focus on seven common exclusion criteria in cancer trials: prior malignancy, human immunodeficiency virus, hepatitis B, hepatitis C, psychiatric illness, drug/substance abuse, and autoimmune illness. Our dataset consists of 764 phase III cancer trials with these exclusions annotated at the trial level. We experiment with common transformer models as well as a new pre-trained clinical trial BERT model. Our results demonstrate the feasibility of automatically classifying common exclusion criteria. Additionally, we demonstrate the value of a pre-trained language model specifically for clinical trials, which yield the highest average performance across all criteria.

研究动机与目标

  • 为解决由于入选标准为非结构化自然语言而造成的人工、耗时的患者-试验匹配问题。
  • 开发自动化文本分类模型,从临床试验注册库的自由文本入选描述中识别关键排除标准。
  • 评估通用型和领域特定 BERT 模型在分类 III 期癌症试验中七种常见排除标准方面的性能。
  • 创建并发布一种新型预训练语言模型 ClinicalTrialBERT,该模型专门在临床试验入选标准上进行微调,以提升下游分类性能。
  • 调查 ClinicalTrials.gov 与方案书/出版物在排除标准报告方面存在的差异。

提出的方法

  • 从 ClinicalTrials.gov 收集并标注了 764 项 III 期癌症试验,对每项试验标注是否存在七种排除标准。
  • 在标注数据集上微调了五种最先进的领域特定 BERT 模型,包括新预训练的 ClinicalTrialBERT 模型。
  • 在约 50 万份来自 ClinicalTrials.gov 的入选标准部分上对 ClinicalTrialBERT 进行预训练,以增强领域特定表示学习。
  • 在所有七种排除标准的试验和标准两个层面,使用精确率、召回率和 F1 分数评估模型性能。
  • 采用迁移学习技术,将预训练语言模型适配至临床试验文本分类任务。
  • 在初始标注阶段使用基于关键词的启发式方法,以确保高召回率,支持稳健的模型训练。

实验结果

研究问题

  • RQ1基于 BERT 的模型能否有效分类以自然语言书写的癌症试验入选标准中的常见排除标准?
  • RQ2与通用型及其他领域特定 BERT 模型相比,领域特定预训练语言模型(ClinicalTrialBERT)在分类这些标准方面表现如何?
  • RQ3模型性能指标(精确率、召回率、F1)在不同类型的排除标准之间差异有多大,特别是对于表述模糊或改写过的标准?
  • RQ4排除标准在 ClinicalTrials.gov、研究方案和已发表论文之间的一致性如何?
  • RQ5所提出的框架能否推广至非肿瘤学试验,或扩展至包含当前七项以外的更多标准?

主要发现

  • ClinicalTrialBERT 模型在所有七项排除标准上的平均 F1 分数最高,证明了在临床试验入选文本上进行领域特定预训练的价值。
  • 表现最佳的模型在 F1 分数上达到 0.94 至 1.00,表明在分类排除标准方面具有高精确率和高召回率。
  • 本研究证实,使用基于 Transformer 的模型进行文本分类在识别癌症试验中的关键排除标准方面是可行且有效的。
  • 许多试验在 ClinicalTrials.gov、方案书和出版物之间对排除标准的披露存在不一致,凸显了公共注册库中的数据质量问题。
  • 结果表明,该方法可显著减少大规模应用时的人工患者-试验匹配工作量。
  • ClinicalTrialBERT 的开发为未来临床试验 NLP 应用提供了可复用、高性能的基础模型,超越本研究的范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。