[论文解读] Improving Biomedical Pretrained Language Models with Knowledge
该论文提出 KeBioLM,一种通过文本编码与文本-实体融合编码整合 UMLS 知识库中实体与关系的知识增强型生物医学语言模型,并采用联合预训练策略进行实体识别与链接。KeBioLM 在 BLURB 基准的命名实体识别与关系抽取任务中达到最先进性能,并在 UMLS 三元组探针任务中展现出更优的知识吸收能力,优于 BioBERT、ClinicalBERT 和 BlueBERT 等模型。
Pretrained language models have shown success in many natural language processing tasks. Many works explore incorporating knowledge into language models. In the biomedical domain, experts have taken decades of effort on building large-scale knowledge bases. For example, the Unified Medical Language System (UMLS) contains millions of entities with their synonyms and defines hundreds of relations among entities. Leveraging this knowledge can benefit a variety of downstream tasks such as named entity recognition and relation extraction. To this end, we propose KeBioLM, a biomedical pretrained language model that explicitly leverages knowledge from the UMLS knowledge bases. Specifically, we extract entities from PubMed abstracts and link them to UMLS. We then train a knowledge-aware language model that firstly applies a text-only encoding layer to learn entity representation and applies a text-entity fusion encoding to aggregate entity representation. Besides, we add two training objectives as entity detection and entity linking. Experiments on the named entity recognition and relation extraction from the BLURB benchmark demonstrate the effectiveness of our approach. Further analysis on a collected probing dataset shows that our model has better ability to model medical knowledge.
研究动机与目标
- 通过显式整合如 UMLS 等大规模生物医学知识库中的结构化知识,提升生物医学预训练语言模型的性能。
- 解决通用领域 PLM 在捕捉特定医学事实、术语与关系方面的局限性。
- 开发一种通过联合预训练实体识别与实体链接任务来学习鲁棒实体表征的模型。
- 评估知识增强型模型是否相较于标准生物医学 PLM 更好地捕捉关系型医学知识。
- 基于 UMLS 关系三元组,为探测量化 PLM 中医学知识理解能力提供基准。
提出的方法
- 该模型采用双编码架构:一个仅处理原始文本的文本编码层,以及一个将标记级与实体级表征相融合的文本-实体融合编码层。
- 实体表征通过 TransE 嵌入初始化,以从 UMLS 知识图谱中编码实体与关系信息。
- 引入两项额外的预训练目标——实体识别与实体链接,以提升模型识别并定位文本中实体的能力。
- 使用 ScispaCy 将 PubMed 摘要中的实体链接至 UMLS,共在 350 万篇文档中标注 6.6 亿个实体。
- 在探针任务中,采用掩码式 UMLS 关系三元组进行闭合式任务评估,解码策略包括基于置信度的选择与束搜索。
- 评估采用关系级别宏召回率@5,衡量模型恢复被掩码实体正确 CUI 的能力。
实验结果
研究问题
- RQ1将来自 UMLS 的结构化知识整合是否能提升生物医学语言模型在命名实体识别与关系抽取任务上的性能?
- RQ2与标准预训练相比,联合预训练实体识别与链接任务是否能带来更优的实体表征学习?
- RQ3像 KeBioLM 这样的生物医学 PLM 在多大程度上能捕捉并利用来自 UMLS 的关系知识,尤其是针对罕见或复杂关系?
- RQ4KeBioLM 在建模医学知识方面与现有生物医学 PLM(如 BioBERT、ClinicalBERT 和 BlueBERT)相比表现如何?
- RQ5基于 UMLS 三元组的探针任务是否能有效衡量模型对生物医学知识的内化程度?
主要发现
- KeBioLM 在 BLURB 基准的 5 个 NER 数据集上平均 F1 得分为 87.1,在 3 个 RE 数据集上得分为 81.2,优于先前方法。
- 在 UMLS 探针任务中,KeBioLM 的关系级别宏召回率@5 达到 3.26,显著优于 SciBERT(2.75)、ClinicalBERT(0.79)、BlueBERT(1.02),以及因缺少层而无法直接评估的 BioBERT。
- 在 Type 2 查询(答案不在输入中)中,KeBioLM 达到 1.48 的召回率@5,表明其在未见或复杂关系上的强大泛化能力。
- 定性分析显示,KeBioLM 正确识别了同义词(如 'liver' 对应 'hepatic')与关系事实(如 'vaccination may prevent tetanus'),证明其知识定位准确。
- 在 Type 1 查询(共 24,260 个)中,KeBioLM 达到 14.01 的召回率@5,表明其在从上下文中检索知识方面具有高度可靠性。
- 模型通过基于置信度选择的束搜索解码多标记实体的能力,证实其在处理复杂生物医学实体跨度时的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。