Skip to main content
QUICK REVIEW

[论文解读] A PubMedBERT-based Classifier with Data Augmentation Strategy for Detecting Medication Mentions in Tweets

Qing Han, Shubo Tian|arXiv (Cornell University)|Nov 3, 2021
Biomedical Text Mining and Ontologies被引用 10
一句话总结

本文提出了一种基于PubMedBERT的分类器,结合多策略数据增强方法,用于检测推文中的药物提及。通过解决非标准语言和类别不平衡等挑战,该方法在BioCreative VII Track 3基准测试中取得了0.762的F1分数,显著优于平均提交结果。

ABSTRACT

As a major social media platform, Twitter publishes a large number of user-generated text (tweets) on a daily basis. Mining such data can be used to address important social, public health, and emergency management issues that are infeasible through other means. An essential step in many text mining pipelines is named entity recognition (NER), which presents some special challenges for tweet data. Among them are nonstandard expressions, extreme imbalanced classes, and lack of context information, etc. The track 3 of BioCreative challenge VII (BC7) was organized to evaluate methods for detecting medication mentions in tweets. In this paper, we report our work on BC7 track 3, where we explored a PubMedBERT-based classifier trained with a combination of multiple data augmentation approaches. Our method achieved an F1 score of 0.762, which is substantially higher than the mean of all submissions (0.696).

研究动机与目标

  • 为解决在推文中检测药物提及的挑战,这些推文的特点是非标准语言、极端类别不平衡以及上下文有限。
  • 通过预训练语言模型提升在低资源、嘈杂社交媒体文本中的命名实体识别(NER)性能。
  • 评估结合多种数据增强策略在提升模型泛化能力和在类别不平衡的推文数据上性能方面的有效性。
  • 为低资源、非正式文本环境中的药物提及检测提供一种稳健且可迁移的方法。

提出的方法

  • 对PubMedBERT进行微调,这是一种在生物医学文献上预训练的领域特定BERT变体,用于在推文数据上进行序列标注。
  • 应用多种数据增强技术,包括回译、同义词替换和同义词插入,以增加训练数据的多样性并缓解类别不平衡。
  • 采用条件生成方法,创建具有药物提及的合成但语言上合理的推文。
  • 在训练过程中使用类别重加权和焦点损失,进一步缓解推文中药物实体的长尾分布问题。
  • 在包含人工标注的推文中药物提及的BC7 Track 3数据集上端到端训练模型。
  • 使用标准NER指标(包括精确率、召回率和F1分数)在官方测试集上评估模型性能。

实验结果

研究问题

  • RQ1尽管存在语言变异和上下文稀疏性,基于PubMedBERT的模型是否能有效检测非正式、嘈杂的推文文本中的药物提及?
  • RQ2结合多种数据增强策略对低资源、类别不平衡的推文中药物提及检测的模型性能有何影响?
  • RQ3与无增强的基线模型相比,数据增强在提升泛化能力和F1分数方面有多大程度的改善?
  • RQ4与通用领域模型相比,将领域特定预训练(PubMedBERT)与数据增强相结合是否能在社交媒体健康文本上取得更优结果?

主要发现

  • 所提出的基于PubMedBERT的分类器结合数据增强,在BC7 Track 3测试集上取得了0.762的F1分数,显著优于平均提交分数0.696。
  • 回译、同义词替换和条件生成的结合提升了模型对罕见药物实体的鲁棒性和泛化能力。
  • 数据增强的使用减轻了类别不平衡的影响,使代表性不足的药物提及召回率更高。
  • 模型在未登录词和拼写错误词汇上表现出色,表明其能有效处理推文中的非标准语言形式。
  • 与基线微调的BERT模型相比,PubMedBERT与针对性数据增强策略的结合显著提升了F1分数。
  • 结果证实,领域特定预训练结合多策略数据增强在低资源、嘈杂社交媒体文本的NER任务中是有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。