QUICK REVIEW
[论文解读] RuBioRoBERTa: a pre-trained biomedical language model for Russian language biomedical text mining
Alexander Yalunin, Alexander I. Nesterov|arXiv (Cornell University)|Apr 8, 2022
Biomedical Text Mining and Ontologies被引用 4
一句话总结
本论文提出 RuBioRoBERTa,一种在 CyberLeninka 上 12 亿字俄语医学文本上预训练的生物医学语言模型,在 RuMedBench 基准的文本分类、问答、自然语言推理(NLI)、命名实体识别(NER)和症状预测任务中均取得最先进性能。在下游任务上微调后,其表现优于通用领域模型和先前最先进模型,整体得分达 71.54%,并在药物评论分类任务上超越人类表现。
ABSTRACT
This paper presents several BERT-based models for Russian language biomedical text mining (RuBioBERT, RuBioRoBERTa). The models are pre-trained on a corpus of freely available texts in the Russian biomedical domain. With this pre-training, our models demonstrate state-of-the-art results on RuMedBench - Russian medical language understanding benchmark that covers a diverse set of tasks, including text classification, question answering, natural language inference, and named entity recognition.
研究动机与目标
- 开发一种针对俄语生物医学文本挖掘的专用预训练语言模型,以解决非英语语言中领域适配的 NLP 资源匮乏问题。
- 通过在大规模俄语医学文献语料上预训练的模型进行微调,提升在文本分类、命名实体识别(NER)和自然语言推理等多样化医学 NLP 任务上的性能。
- 通过发布 RuBioRoBERTa 和 RuBioBERT 作为未来研究的强基线,建立俄语医学 NLP 的新基准。
- 通过在 RuMedBench 基准上对比领域特定预训练模型与通用领域模型的表现,验证领域特定预训练的有效性。
提出的方法
- 在通用领域俄语语料上预训练三个基于 BERT 的模型(RuBERT、ruBERT 和 ruRoBERTa),随后在精选的生物医学语料上进行进一步预训练。
- 从 CyberLeninka 收集了 33.8 万篇俄语医学文章(共 12 亿词)构成生物医学语料,涵盖基础医学、临床医学、生物技术和健康科学。
- 使用 3 张 V100 GPU 对生物医学语料进行一周期的额外预训练,学习率从 5e-5 渐进升温并采用余弦衰减,耗时 12 天。
- 使用标准超参数在 RuMedBench 基准的五个下游任务上对最终的 RuBioRoBERTa 模型进行微调:10 个训练周期,批量大小为 32,峰值初始学习率 3e-5 并采用余弦退火。
- 使用 HuggingFace 进行模型训练与推理,词汇表大小分别为 12 万(BERT)和 5 万(RoBERTa),模型参数量在 1.78 亿至 3.55 亿之间。
- 使用标准指标评估在文本分类、症状推荐、是/否问答、自然语言推理和命名实体识别任务上的性能。
实验结果
研究问题
- RQ1在大规模俄语生物医学语料上进行额外预训练,是否能显著提升下游医学 NLP 任务的性能?
- RQ2像 RuBioRoBERTa 这类领域适配模型与通用领域模型(如 ruRoBERTa)以及先前最先进模型相比,在 RuMedBench 基准上的表现如何?
- RQ3俄语生物医学语言模型在特定医学文本理解任务中,能在多大程度上超越人类专家?
- RQ4生物医学预训练在识别医学缩写、疾病和症状方面带来了哪些定性改进?
主要发现
- RuBioRoBERTa 在 RuMedBench 基准上取得 71.54% 的最高总体得分,较先前最先进模型高出 4.34 个百分点。
- 在 Top3 任务(ICD-10 编码预测)中,RuBioRoBERTa 达到 46.72% 的准确率和 72.87% 的 hit@3,优于先前最佳结果 47.45%/70.44%。
- 在 SymRec 任务(症状推荐)中,RuBioRoBERTa 达到 44.01% 的准确率和 58.95% 的 hit@3,显著优于 ruRoBERTa 的 40.92%/54.37%。
- RuBioRoBERTa 在 NLI 任务中达到 82.77% 的准确率,在 NER 任务中达到 97.19% 的 F1 值,两项均超过先前最先进水平,其中 NER 的 F1 值甚至超过人类表现(76.18%)。
- 模型在 NLI 任务中正确识别了医学缩写(如 ACA 代表急性脑血管意外),表明其对临床术语的理解能力得到提升。
- 定性分析表明,RuBioRoBERTa 更好地识别了疾病名称(如肺炎),并能提供输入文本中未明确提及但更相关的症状推荐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。