Skip to main content
QUICK REVIEW

[论文解读] MedMine: Examining Pre-trained Language Models on Medication Mining

Haifa Alrdahi, Lifeng Han|arXiv (Cornell University)|Aug 7, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本论文提出 MedMine 框架,利用 n2c2-2018 共享任务数据集评估微调后的预训练语言模型——Med7 和 XLM-RoBERTa——在临床文本中的药物挖掘性能。结果表明,XLM-RoBERTa 的准确率显著更高(96.76%),远超 Med7+(81.87%),凸显了多语言 BERT 基础模型相较于领域特定的 GloVe 基础模型在临床实体抽取任务中的优势。

ABSTRACT

Automatic medication mining from clinical and biomedical text has become a popular topic due to its real impact on healthcare applications and the recent development of powerful language models (LMs). However, fully-automatic extraction models still face obstacles to be overcome such that they can be deployed directly into clinical practice for better impacts. Such obstacles include their imbalanced performances on different entity types and clinical events. In this work, we examine current state-of-the-art pre-trained language models (PLMs) on such tasks, via fine-tuning including the monolingual model Med7 and multilingual large language model (LLM) XLM-RoBERTa. We compare their advantages and drawbacks using historical medication mining shared task data sets from n2c2-2018 challenges. We report the findings we get from these fine-tuning experiments such that they can facilitate future research on addressing them, for instance, how to combine their outputs, merge such models, or improve their overall accuracy by ensemble learning and data augmentation. MedMine is part of the M3 Initiative \url{https://github.com/HECTA-UoM/M3}

研究动机与目标

  • 评估最先进的预训练语言模型(PLM)在临床文本药物挖掘中的性能,重点关注实体与事件抽取。
  • 解决训练数据中药物、剂量、持续时间及不良药物反应(ADE)等实体类型性能不平衡的问题,这些类型在训练数据中代表性不足。
  • 通过对比 Med7+ 与临床 XLM-R 输出,探索模型融合与集成学习策略,以提升整体抽取准确率。
  • 作为 M3 计划的一部分,开发一个开源、可扩展的工具包——MedMine,以支持未来低资源临床 NLP 研究。
  • 探究数据增强与基于提示的学习(prompt-based learning)在改善药物挖掘中罕见标签预测性能方面的潜力。

提出的方法

  • 使用 SpaCy 和 GloVe 嵌入在 n2c2-2018 数据集上微调单语临床模型 Med7,用于 9 种与药物相关的标签命名实体识别(NER)。
  • 在相同的 n2c2-2018 数据集上微调多语言 XLM-RoBERTa-base 模型,利用其在 100 种语言上的预训练优势,提升临床 NLP 中的泛化能力。
  • 对超过 512 个 token 的序列应用文档分块处理,将长临床记录拆分为 512 个 token 的片段,可能存在上下文丢失。
  • 采用标准 NER 评估指标(精确率、召回率、F1)在微观、宏观和加权平均层面比较不同标签类型下的模型性能。
  • 通过分析互补优势探索模型组合策略:Med7+ 在多数标签上表现出更高的精确率,而临床 XLM-R 则展现出更高的召回率。
  • 计划未来集成基于 GPT 的模型与基于提示的学习(PBL),结合人工模板与软提示,用于时间与关系型药物建模。

实验结果

研究问题

  • RQ1微调后的 Med7 与 XLM-RoBERTa 模型在临床文本药物实体与事件抽取任务中的性能表现如何?
  • RQ2当前基于 PLM 的药物挖掘系统在不同标签类型(如药物、剂量、持续时间、ADE)之间存在哪些关键性能不平衡?
  • RQ3通过集成学习或模型融合,结合 Med7+ 与临床 XLM-R 的输出是否能提升整体 F1 分数?
  • RQ4尽管 Med7 是在临床数据上预训练的,XLM-RoBERTa 的多语言预训练是否仍能带来优于领域特定微调的 Med7 的性能表现?
  • RQ5数据增强或基于提示的学习在多大程度上可缓解药物挖掘中低频标签的问题?

主要发现

  • XLM-RoBERTa 在 n2c2-2018 测试集上实现了显著更高的整体准确率(96.76%),远超 Med7+ 的 81.87%。
  • Med7+ 在全部 7 个共享标签上均优于原始 Med7 模型,微平均 F1 达 0.9244(原为 0.7400),宏平均 F1 达 0.9045(原为 0.7200),加权 F1 达 0.9247(原为 0.7700)。
  • Med7+ 在大多数标签上表现出更高的精确率,而临床 XLM-R 则展现出更高的召回率,表明两种模型具有互补优势。
  • 标签 'route' 在 Med7+ 上的性能提升微乎其微(F1:0.96 vs. 0.96),表明该类别已接近性能上限,改进空间有限。
  • 低频标签 'duration'(139 个实例)与 'ADE'(242 个实例)表现出显著较低的性能,表明需要数据增强或合成数据生成。
  • Med7+ 与临床 XLM-R 之间的性能差距表明,即使经过领域特定微调,多语言预训练或 BERT 基础表示仍可能在临床 NLP 任务中优于 GloVe 嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。