Skip to main content
QUICK REVIEW

[论文解读] BioMegatron: Larger Biomedical Domain Language Model

Hoo-Chang Shin, Yang Zhang|arXiv (Cornell University)|Oct 12, 2020
Topic Modeling参考文献 19被引用 11
一句话总结

本文介绍了BioMegatron,一个在大量PubMed摘要和完整版PMC文章上预训练的更大规模生物医学语言模型,在生物医学NLP任务上表现出最先进的性能。结果表明,与模型大小相比,领域特定词汇和针对性预训练更为关键,BioMegatron-1.2b在命名实体识别、关系抽取和问答基准上均取得了SOTA结果。

ABSTRACT

There has been an influx of biomedical domain-specific language models, showing language models pre-trained on biomedical text perform better on biomedical domain benchmarks than those trained on general domain text corpora such as Wikipedia and Books. Yet, most works do not study the factors affecting each domain language application deeply. Additionally, the study of model size on domain-specific models has been mostly missing. We empirically study and evaluate several factors that can affect performance on domain language applications, such as the sub-word vocabulary set, model size, pre-training corpus, and domain transfer. We show consistent improvements on benchmarks with our larger BioMegatron model trained on a larger domain corpus, contributing to our understanding of domain language model applications. We demonstrate noticeable improvements over the previous state-of-the-art (SOTA) on standard biomedical NLP benchmarks of named entity recognition, relation extraction, and question answering. Model checkpoints and code are available at [https://ngc.nvidia.com] and [https://github.com/NVIDIA/NeMo].

研究动机与目标

  • 研究模型大小、词汇选择、预训练语料和领域迁移对生物医学语言模型性能的影响。
  • 解决生物医学NLP中模型扩展和领域特定因素研究不足的问题。
  • 提升在关键生物医学NLP基准(如命名实体识别、关系抽取和问答)上的性能。
  • 证明即使参数量更小,领域定制模型也优于通用领域模型,前提是具备合适的词汇和预训练策略。
  • 提供开源模型检查点和代码,以支持生物医学NLP领域的可复现性和进一步研究。

提出的方法

  • 使用Megatron-LM框架,对三种参数量(345M、800M和1.2B)的BioMegatron变体进行预训练,实现高效的模型并行训练。
  • 采用包含45亿词的PubMed摘要和16亿词的CC许可PMC全文文章的联合预训练语料。
  • 对比通过SentencePiece在生物医学文本上学习的不同子词词汇表(3万和5万个单元),并评估无大小写和有大小写区分的BERT风格词汇表。
  • 从零开始训练模型,并与从通用领域检查点(如BERT-uncased)微调的模型进行比较,以评估迁移学习效果。
  • 在标准生物医学基准上评估性能:BC5CDR和NCBI-disease用于命名实体识别,ChemProt用于关系抽取,BioASQ-7b用于问答任务。
  • 使用标准指标,如命名实体识别和问答任务的F1分数,以及序列分类任务的准确率。

实验结果

研究问题

  • RQ1与词汇选择和预训练语料相比,模型大小对生物医学NLP任务性能的影响如何?
  • RQ2使用从生物医学文本中学习的领域特定子词词汇表,与通用领域词汇表相比,其影响是什么?
  • RQ3与从零开始训练相比,从通用领域语言模型检查点微调是否能提升在生物医学基准上的性能?
  • RQ4与仅使用摘要的预训练相比,在更大规模生物医学语料(包括完整PMC全文)上预训练,如何影响下游任务性能?
  • RQ5在标签偏差较高的低资源生物医学NLP任务中,领域特定预训练在多大程度上能缓解性能差距?

主要发现

  • BioMegatron-1.2b在SQuAD-v1.1上取得91.8的F1分数,在SQuAD-v2.0上取得86.4,优于通用领域的BERT-Large和RoBERTa模型。
  • 使用5万领域词汇的345M模型在SQuAD-v1.1上取得91.6的F1分数,优于BERT-Large(90.9 F1),表明词汇选择的影响可能超过模型大小。
  • BioMegatron-800m在SQuAD-v1.1上取得91.6 F1,在SQuAD-v2.0上取得86.1,表明在领域特定文本上预训练的更大模型比更小的通用领域模型泛化能力更强。
  • 微调后的BioMegatron模型(如BioMegatron-345m-ft)在SQuAD-v1.1上的表现(86.5 F1)低于其预训练版本,表明领域特定预训练比从通用领域模型迁移更有效。
  • 尽管参数量更大,BioMegatron-1.2b在BioASQ-7b上的表现并未优于BioMegatron-800m,表明在标签偏差较高的小规模生物医学问答数据集上可能存在过拟合现象。
  • 研究发现,生物医学数据集中的标签偏差显著高于通用领域数据集(如BioASQ-7b的偏差为0.02,而SQuAD的偏差为0.4),凸显了数据稀缺和不平衡带来的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。