[论文解读] BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model
本文提出 BioBART,一种在 PubMed 摘要上使用去噪自编码目标进行预训练的生物医学生成式语言模型。BioBART 在多个生物医学自然语言生成任务上优于 BART 和最先进方法,包括对话、摘要生成、实体链接和命名实体识别,而消融研究显示,预训练期间的句子置换会损害性能。
Pretrained language models have served as important backbones for natural language processing. Recently, in-domain pretraining has been shown to benefit various domain-specific downstream tasks. In the biomedical domain, natural language generation (NLG) tasks are of critical importance, while understudied. Approaching natural language understanding (NLU) tasks as NLG achieves satisfying performance in the general domain through constrained language generation or language prompting. We emphasize the lack of in-domain generative language models and the unsystematic generative downstream benchmarks in the biomedical domain, hindering the development of the research community. In this work, we introduce the generative language model BioBART that adapts BART to the biomedical domain. We collate various biomedical language generation tasks including dialogue, summarization, entity linking, and named entity recognition. BioBART pretrained on PubMed abstracts has enhanced performance compared to BART and set strong baselines on several tasks. Furthermore, we conduct ablation studies on the pretraining tasks for BioBART and find that sentence permutation has negative effects on downstream tasks.
研究动机与目标
- 为解决生物医学 NLP 领域内生成式语言模型的缺乏,通过将 BART 适配至生物医学领域来实现。
- 汇集并发布一个全面的现有生物医学自然语言生成任务基准,以实现标准化评估。
- 研究不同预训练目标(尤其是句子置换)对下游生物医学 NLG 任务的影响。
- 通过在多样化生物医学数据集上系统性地进行预训练和评估,为生物医学 NLG 建立强有力的基线。
- 通过生成式建模提升生物医学语言理解能力,特别是在实体链接和命名实体识别等任务上。
提出的方法
- 使用 BART 架构并在 PubMed 摘要上采用去噪自编码目标对 BioBART 进行预训练。
- 仅使用文本填空预训练任务,不包含句子置换,以保持在下游 NLG 任务上的性能。
- 在多个生物医学 NLG 基准上微调 BioBART,包括对话(CovidDialog)、摘要生成(MeQSum、iCliniq)、实体链接(AAP、BC5CDR)和 NER(ShARe13、GENIA)。
- 通过比较在有无句子置换目标下预训练的模型,开展消融研究以评估其影响。
- 使用 Rouge、BLEU、F1 和 Recall@1 等标准指标,在多样化生物医学 NLP 任务上评估性能。
- 发布代码、模型检查点以及经过筛选的生物医学 NLG 数据集基准,以支持可复现性和未来研究。
实验结果
研究问题
- RQ1在生物医学文本上预训练类似 BART 的生成式语言模型,是否能提升其在下游生物医学 NLG 任务上的性能?
- RQ2在预训练过程中包含句子置换是否会影响生成式模型在生物医学 NLG 基准上的表现?
- RQ3像 BioBART 这样的领域适配生成式模型,能否作为生物医学对话、摘要生成和实体链接任务的强基线?
- RQ4在 PubMed 摘要上进行领域内预训练,与通用领域模型(如 BART)相比,能在多大程度上缓解领域偏移问题?
- RQ5生成式建模能否有效处理生物医学 NER 和实体链接任务?与判别式最先进方法相比表现如何?
主要发现
- 在 CovidDialog 对话生成基准上,BioBART-large 在 Rouge-2 上优于 BART-large 1.71 分,在 Rouge-L 上优于 0.03 分。
- 在 MeQSum 摘要生成数据集上,BioBART-large 在 Rouge-1/2/L 上分别优于 BART-large 1.93/1.31/2.1 分,超越当前最先进方法。
- 在实体链接任务中,BioBART 在 AAP、BC5CDR 和 COMETA 上分别将 Recall@1 提升 0.4、1.67 和 1.36 分,超过判别式 SOTA 方法。
- 在 NER 任务中,BioBART-large 在 ShARe13 上将实体级别 F1 提升 1.06 分,在 GENIA 上提升 1.00 分,尽管与最佳判别式模型仍有差距,但展现出强大的生成性能。
- 消融研究显示,排除句子置换预训练任务可获得更好性能,因其引入会降低多个 NLG 任务的结果。
- 定性示例表明,BioBART 在生物医学常识和文档理解方面表现更优,尤其能纠正 BART 生成中存在事实性错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。