Skip to main content
QUICK REVIEW

[论文解读] EPICURE Ensemble Pretrained Models for Extracting Cancer Mutations from Literature

Jiarun Cao, Elke M. van Veen|arXiv (Cornell University)|Jun 11, 2021
Topic Modeling参考文献 28被引用 4
一句话总结

EPICURE 通过引入结合条件随机场(CRF)和跨度预测层的预训练模型集成,提升了从生物医学文献中提取癌症突变的能力。通过在基准数据集上进行数据增强和微调,该模型在癌症突变命名实体识别任务中达到最先进性能,克服了以往基于规则和低资源方法的局限性。

ABSTRACT

To interpret the genetic profile present in a patient sample, it is necessary to know which mutations have important roles in the development of the corresponding cancer type. Named entity recognition is a core step in the text mining pipeline which facilitates mining valuable cancer information from the scientific literature. However, due to the scarcity of related datasets, previous NER attempts in this domain either suffer from low performance when deep learning based models are deployed, or they apply feature based machine learning models or rule based models to tackle this problem, which requires intensive efforts from domain experts, and limit the model generalization capability. In this paper, we propose EPICURE, an ensemble pre trained model equipped with a conditional random field pattern layer and a span prediction pattern layer to extract cancer mutations from text. We also adopt a data augmentation strategy to expand our training set from multiple datasets. Experimental results on three benchmark datasets show competitive results compared to the baseline models.

研究动机与目标

  • 解决生物医学文献中癌症突变提取标注数据集稀缺的问题。
  • 利用深度学习提升癌症相关突变的命名实体识别性能。
  • 通过预训练和数据增强技术,减少对专家设计规则或手工特征的依赖。
  • 开发一种可泛化、高性能的模型,用于从科学文本中挖掘具有临床意义的突变信息。

提出的方法

  • 该模型采用在多个癌症突变数据集上微调的预训练语言模型集成。
  • 引入条件随机场(CRF)层,以建模序列标注中的标签依赖关系。
  • 使用跨度预测头直接识别突变跨度,提升定位精度。
  • 应用数据增强技术,从多个源数据集扩展训练数据。
  • 将上下文表征与结构化预测相结合,以增强实体识别性能。
  • 在三个基准数据集上进行微调,以评估模型的泛化能力和性能表现。

实验结果

研究问题

  • RQ1结合CRF和跨度预测层的预训练模型集成是否能在癌症突变提取任务中超越现有方法?
  • RQ2数据增强在提升低资源突变标注任务模型性能方面效果如何?
  • RQ3结构化预测(CRF)与跨度检测的结合在生物医学文本中对实体定位的改善程度如何?
  • RQ4所提出的模型在具有不同标注方案的多样化癌症突变数据集上是否具备良好的泛化能力?
  • RQ5该模型能否在保持高性能的同时减少对专家手工特征的依赖?

主要发现

  • EPICURE 模型在三个癌症突变提取基准数据集上表现出具有竞争力的性能。
  • CRF 与跨度预测层的集成相比基线模型,显著提升了序列标注的准确性。
  • 数据增强有效扩展了训练数据,增强了模型的鲁棒性与泛化能力。
  • 在 F1 分数和召回率方面,该模型优于以往的基于规则和特征工程的方法。
  • 在多个数据集上进行微调,使模型在不同突变类型和文本领域中均实现了稳定的性能提升。
  • 集成方法在多样化生物医学文献来源中展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。