Skip to main content
QUICK REVIEW

[论文解读] CamemBERT-bio: Leveraging Continual Pre-training for Cost-Effective Models on French Biomedical Data

Rian Touchent, Laurent Romary|arXiv (Cornell University)|Jun 27, 2023
Topic Modeling被引用 4
一句话总结

本文介绍了 CamemBERT-bio,这是一个通过在4.13亿词的法语生物医学语料上持续预训练而微调的公开可用法语生物医学语言模型。该模型在命名实体识别任务上实现了平均F1分数2.54个百分点的提升,证明了尽管近期有相反说法,针对法语临床NLP进行领域特定预训练仍具有效性。

ABSTRACT

Clinical data in hospitals are increasingly accessible for research through clinical data warehouses. However these documents are unstructured and it is therefore necessary to extract information from medical reports to conduct clinical studies. Transfer learning with BERT-like models such as CamemBERT has allowed major advances for French, especially for named entity recognition. However, these models are trained for plain language and are less efficient on biomedical data. Addressing this gap, we introduce CamemBERT-bio, a dedicated French biomedical model derived from a new public French biomedical dataset. Through continual pre-training of the original CamemBERT, CamemBERT-bio achieves an improvement of 2.54 points of F1-score on average across various biomedical named entity recognition tasks, reinforcing the potential of continual pre-training as an equally proficient yet less computationally intensive alternative to training from scratch. Additionally, we highlight the importance of using a standard evaluation protocol that provides a clear view of the current state-of-the-art for French biomedical models.

研究动机与目标

  • 为解决通用型法语语言模型(如CamemBERT)在生物医学文本上表现不佳的问题,原因在于领域不匹配。
  • 创建一个公开可用、符合隐私合规要求的法语生物医学语言模型,供各医疗机构使用。
  • 证明在特定领域法语生物医学文本上进行持续预训练,可显著提升命名实体识别任务的性能。
  • 倡导采用标准化评估协议,以确保法语生物医学模型评估的公平性与可复现性。

提出的方法

  • 在新整理的法语生物医学语料(biomed-fr)上对CamemBERT base模型进行持续预训练,该语料包含来自药品说明书和科学文献的4.13亿词。
  • 预训练语料由法语临床报告、药品信息单和生物医学出版物构建,确保领域相关性。
  • 使用标准NLP评估指标,在多个法语生物医学命名实体识别基准上对模型进行微调。
  • 评估遵循标准化协议,采用精确匹配的字符偏移量,以避免预处理偏差,与CLEF eHealth的BRATeval框架保持一致。
  • 训练在两块Tesla V100 GPU上进行,耗时约39小时,预计二氧化碳排放量为0.84 kg CO2 eq。
  • 与近期模型(如DrBERT和BioBERT)进行了对比分析,以评估性能和方法论的一致性。

实验结果

研究问题

  • RQ1在特定领域生物医学文本上对法语语言模型进行持续预训练,是否能显著提升其在法语生物医学NLP任务上的性能?
  • RQ2为何近期声称在法语生物医学数据上进行持续预训练无效的说法需要重新评估?
  • RQ3采用标准化评估协议在多大程度上影响了法语生物医学NLP中模型性能的解读?
  • RQ4CamemBERT-bio与DrBERT和BioBERT等其他最先进模型相比,在F1分数和各类别性能上表现如何?
  • RQ5'O'类(非实体标记)在决定模型排名中起什么作用,它如何影响性能解读?

主要发现

  • 与基础CamemBERT模型相比,CamemBERT-bio在多个法语生物医学命名实体识别基准上实现了平均2.54个百分点的F1分数提升。
  • 该模型在所评估的法语生物医学NLP任务中建立了新的最先进性能,优于测试设置中的通用型和专用型模型。
  • 尽管有声称持续预训练会导致性能下降,但本研究证明此类结果可能源于评估方法的缺陷,而非模型本身的固有限制。
  • 当采用'不包含O类'的评估协议时,DrBERT模型在宏平均F1上优于CamemBERT-bio,凸显评估设计对模型排名的决定性影响。
  • 本研究强调了标准化评估协议(如BRATeval的精确匹配与字符偏移)的重要性,以确保公平且可复现的基准测试。
  • 预训练CamemBERT-bio的环境影响极小,仅排放0.84 kg CO2 eq,表明其为成本效益高且可持续的模型适配方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。