Skip to main content
QUICK REVIEW

[论文解读] DrBERT: A Robust Pre-trained Model in French for Biomedical and Clinical domains

Yanis Labrak, Adrien Bazoge|arXiv (Cornell University)|Apr 3, 2023
Natural Language Processing Techniques被引用 4
一句话总结

本文介绍了 DrBERT,这是首个基于 RoBERTa 的法语生物医学与临床领域预训练语言模型,其在大型公开医学语料库(NACHOS)上进行训练。研究结果表明,持续在公开生物医学网络数据上进行预训练,可超越仅使用私有临床数据训练的模型,在多个法语医学 NLP 任务中达到最先进性能,同时公开发布模型与数据,并采用开放许可证。

ABSTRACT

In recent years, pre-trained language models (PLMs) achieve the best performance on a wide range of natural language processing (NLP) tasks. While the first models were trained on general domain data, specialized ones have emerged to more effectively treat specific domains. In this paper, we propose an original study of PLMs in the medical domain on French language. We compare, for the first time, the performance of PLMs trained on both public data from the web and private data from healthcare establishments. We also evaluate different learning strategies on a set of biomedical tasks. In particular, we show that we can take advantage of already existing biomedical PLMs in a foreign language by further pre-train it on our targeted data. Finally, we release the first specialized PLMs for the biomedical field in French, called DrBERT, as well as the largest corpus of medical data under free license on which these models are trained.

研究动机与目标

  • 开发首个面向法语生物医学与临床领域的专用预训练语言模型。
  • 评估并比较不同预训练策略(从头训练、持续预训练、混合方法)在医学 NLP 任务中的表现。
  • 发布迄今为止最大的开放获取法语医学文本语料库(NACHOS),并以宽松许可证发布开源 DrBERT 模型。
  • 通过在法语数据上微调英文生物医学模型(如 PubMedBERT)来评估跨语言知识迁移的有效性。
  • 在公共与私有医学 NLP 任务上进行基准测试,涵盖命名实体识别、词性标注和多标签分类等任务。

提出的方法

  • 在大规模、公开可用的法语生物医学语料库(NACHOS)上预训练基于 RoBERTa 的模型,该语料库从多个在线来源爬取。
  • 评估多种预训练策略:在 NACHOS 上从头训练、在现有模型(如 CamemBERT)上进行持续预训练,以及在法语医学数据上微调 PubMedBERT。
  • 构建了一个涵盖 12 种多样化医学 NLP 任务的综合性基准,包括多标签分类、命名实体识别、词性标注和自然语言蕴含任务。
  • 使用来自医院报告(ChuBERT)和公开生物医学网络来源(NACHOS)的领域特定数据进行对比分析。
  • 应用动态掩码并优化训练超参数(批量大小、初始学习率、序列长度),以提升模型收敛性与性能。
  • 所有模型与训练脚本均以 MIT 许可证发布,NACHOS 语料库以 CC0 1.0 许可证发布,确保完全可复现性与可及性。
Figure 1: Vocabularies Inter-coverage Matrix.
Figure 1: Vocabularies Inter-coverage Matrix.

实验结果

研究问题

  • RQ1在公开可用的法语生物医学网络数据上进行预训练,能否实现与在医疗机构私有临床数据上训练的模型相当或更优的性能?
  • RQ2在法语医学数据上对现有英文生物医学模型(如 PubMedBERT)进行持续预训练,是否能获得优于在通用领域法语模型(如 CamemBERT)上微调的效果?
  • RQ3与通用领域模型及英文生物医学模型相比,DrBERT 模型在多样化法语医学 NLP 任务中的表现如何?
  • RQ4领域特定的预训练在多大程度上提升了法语生物医学领域句法与语义任务的性能?
  • RQ5从英文生物医学模型进行跨语言知识迁移,是否能显著提升法语下游任务的性能?

主要发现

  • 在所有评估的法语医学 NLP 任务中,基于 NACHOS 语料库预训练的 DrBERT 模型均优于 CamemBERT 及英文生物医学模型(BioBERT、PubMedBERT、ClinicalBERT)。
  • 尽管医院报告中的临床数据更具专业性,但基于公开生物医学网络数据(NACHOS)训练的模型性能仍可与之相当或更优。
  • 在法语 NACHOS 数据上对 PubMedBERT 进行持续预训练(PubMedBERT NACHOS small)取得了最先进结果,证明了有效的跨语言知识迁移。
  • 专用模型(如 ChuBERT)在通用领域任务(如 XNLI)上的性能显著下降,表明其泛化能力有限。
  • 训练 7 个 DrBERT 模型的环境成本巨大,总计消耗 25,500 GPU 小时,相当于 376.45 kg CO2eq,凸显其高计算需求。
1.a aHF classification
1.a aHF classification

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。