Skip to main content
QUICK REVIEW

[论文解读] Building Chinese Biomedical Language Models via Multi-Level Text Discrimination

Quan Wang, Songtai Dai|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling参考文献 38被引用 9
一句话总结

该论文提出eHealth,一个从零开始预训练的中文生物医学语言模型,采用新颖的多层级文本判别框架,结合词元级与序列级对比学习。该模型在11项中文生物医学NLP任务中超越现有通用领域及生物医学领域PLM,展现出卓越性能与易于部署的优势,得益于其领域内词汇表与无需外部知识的自监督训练。

ABSTRACT

Pre-trained language models (PLMs), such as BERT and GPT, have revolutionized the field of NLP, not only in the general domain but also in the biomedical domain. Most prior efforts in building biomedical PLMs have resorted simply to domain adaptation and focused mainly on English. In this work we introduce eHealth, a Chinese biomedical PLM built from scratch with a new pre-training framework. This new framework pre-trains eHealth as a discriminator through both token- and sequence-level discrimination. The former is to detect input tokens corrupted by a generator and recover their original identities from plausible candidates, while the latter is to further distinguish corruptions of a same original sequence from those of others. As such, eHealth can learn language semantics at both token and sequence levels. Extensive experiments on 11 Chinese biomedical language understanding tasks of various forms verify the effectiveness and superiority of our approach. We release the pre-trained model at \url{https://github.com/PaddlePaddle/Research/tree/master/KG/eHealth} and will also release the code later.

研究动机与目标

  • 为解决缺乏公开可用、高质量的中文生物医学预训练语言模型(PLM)以超越通用领域模型的问题。
  • 通过从零开始训练具有领域特定词汇表与自监督目标的PLM,提升中文生物医学文本理解能力。
  • 开发一种预训练框架,通过多层级文本判别捕捉词元级与序列级语义。
  • 通过避免依赖外部知识库,实现模型的便捷部署,与许多先前的知识增强模型不同。
  • 发布一个公开可访问、高性能的中文生物医学PLM,以促进更广泛的研究与应用。

提出的方法

  • 提出一种受ELECTRA启发的生成器-判别器框架,其中生成器对输入文本进行扰动,判别器学习恢复原始词元并区分被扰动的序列。
  • 采用词元级判别(RTD)检测并从合理候选中恢复被扰动的词元,增强局部语义理解。
  • 引入序列级判别(CSP)利用对比学习,区分同一原始序列的扰动与不同序列的扰动,提升全局上下文建模能力。
  • 从零开始使用新构建的领域内词汇表预训练判别器,提升分词准确性。
  • 采用多任务目标,结合RTD、MTS(掩码词元选择)与CSP,联合优化局部与全局语义表征。
  • 在大规模去标识化的医疗对话、电子病历与教科书数据上进行训练,确保领域特定的表征学习。

实验结果

研究问题

  • RQ1是否可以从零开始使用领域特定词汇表预训练的中文生物医学PLM,在中文生物医学NLP任务中超越通用领域或微调模型?
  • RQ2与标准预训练目标相比,结合词元级与序列级对比学习的多层级文本判别是否能提升中文生物医学文本的语义表征?
  • RQ3与从通用领域模型持续预训练相比,从零开始使用领域内词汇表预训练在性能与效率方面表现如何?
  • RQ4所提出的预训练任务(RTD、MTS、CSP)在个体与整体上对最终模型性能的贡献程度如何?
  • RQ5一个自监督且无需外部知识的PLM能否在中文生物医学NLP中实现SOTA性能,同时在下游应用中保持易于部署?

主要发现

  • eHealth在11项中文生物医学NLP任务中达到SOTA性能,包括文本分类、匹配、信息抽取与问答任务,优于通用领域与生物医学领域PLM。
  • 完整多层级预训练设置(RTD + MTS + CSP)在CBLUE基准上相比标准ELECTRA预训练平均提升0.96%。
  • 移除序列级对比任务(CSP)导致CBLUE上平均性能下降0.45%,而移除词元级MTS任务则导致更大降幅0.87%。
  • 从零开始使用领域内词汇表(R weights + B vocab)的预训练效果优于使用通用领域模型持续预训练(E weights + E vocab),即使仅训练500K步。
  • 领域内词汇表与通用领域词汇表之间的性能差距显著:使用通用领域词汇表(R weights + E vocab)使整体CBLUE得分从73.52%降至73.30%。
  • eHealth在所有评估基准上持续优于更大参数量的模型及现有生物医学PLM(如MC-BERT、PCL-MedBERT、SMedBERT与EMBERT),展现出其有效性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。