Skip to main content
QUICK REVIEW

[论文解读] A Hybrid Approach to Measure Semantic Relatedness in Biomedical Concepts

Katikapalli Subramanyam Kalyan, S. Sangeetha|arXiv (Cornell University)|Jan 25, 2021
Topic Modeling参考文献 36被引用 6
一句话总结

该论文提出了一种混合方法,结合句子 BERT 模型与精炼算法,以改进生物医学概念之间的语义相关性度量。通过在 SNLI 和 STSb 数据集上微调句子 BERT(特别是 SapBERT),并利用精炼算法注入 UMLS 本体关系,该方法在四个基准数据集上实现了最先进性能,包括具有挑战性的多词 EHR-RelB 数据集,优于标准 BERT 模型。

ABSTRACT

Objective: This work aimed to demonstrate the effectiveness of a hybrid approach based on Sentence BERT model and retrofitting algorithm to compute relatedness between any two biomedical concepts. Materials and Methods: We generated concept vectors by encoding concept preferred terms using ELMo, BERT, and Sentence BERT models. We used BioELMo and Clinical ELMo. We used Ontology Knowledge Free (OKF) models like PubMedBERT, BioBERT, BioClinicalBERT, and Ontology Knowledge Injected (OKI) models like SapBERT, CoderBERT, KbBERT, and UmlsBERT. We trained all the BERT models using Siamese network on SNLI and STSb datasets to allow the models to learn more semantic information at the phrase or sentence level so that they can represent multi-word concepts better. Finally, to inject ontology relationship knowledge into concept vectors, we used retrofitting algorithm and concepts from various UMLS relationships. We evaluated our hybrid approach on four publicly available datasets which also includes the recently released EHR-RelB dataset. EHR-RelB is the largest publicly available relatedness dataset in which 89% of terms are multi-word which makes it more challenging. Results: Sentence BERT models mostly outperformed corresponding BERT models. The concept vectors generated using the Sentence BERT model based on SapBERT and retrofitted using UMLS-related concepts achieved the best results on all four datasets. Conclusions: Sentence BERT models are more effective compared to BERT models in computing relatedness scores in most of the cases. Injecting ontology knowledge into concept vectors further enhances their quality and contributes to better relatedness scores.

研究动机与目标

  • 改进生物医学概念之间的语义相关性度量,特别是临床文本中常见的多词术语。
  • 解决标准 BERT 模型在捕捉复杂生物医学概念的短语级语义方面的局限性。
  • 通过将结构化本体知识(UMLS)整合到上下文嵌入中,提升嵌入质量。
  • 在多样且公开可用的数据集上评估所提出方法,包括最近发布的 EHR-RelB,该数据集强调多词概念。
  • 证明句子 BERT 在建模生物医学语境下语义相关性方面优于标准 BERT。

提出的方法

  • 在 SNLI 和 STSb 数据集上使用 Siamese 网络微调句子 BERT 模型(如 SapBERT),以学习句子级别的语义表示。
  • 使用 ELMo、BERT 和句子 BERT 模型生成概念向量,包括用于领域适应的 BioELMo 和 Clinical ELMo。
  • 训练了注入本体知识(OKI)的模型,如 SapBERT、CoderBERT、KbBERT 和 UmlsBERT,以整合 UMLS 关系。
  • 应用精炼算法将基于 UMLS 的本体知识注入预训练的概念向量中,以提升语义一致性。
  • 使用多种生物医学预训练模型(如 PubMedBERT、BioBERT、BioClinicalBERT)作为基线嵌入用于比较。
  • 在四个数据集上评估混合方法,包括 EHR-RelB,其包含 89% 的多词概念,以测试鲁棒性。

实验结果

研究问题

  • RQ1使用句子 BERT 而非标准 BERT 是否能提升生物医学概念的语义相关性得分?
  • RQ2通过 UMLS 本体关系进行精炼是否能提升相关性任务中概念嵌入的质量?
  • RQ3该混合方法在包含高比例多词生物医学术语的数据集(如 EHR-RelB)上的表现如何?
  • RQ4微调后的句子 BERT 与 UMLS 精炼的组合是否比独立模型更有效?
  • RQ5在精炼增强后,OKI 模型(如 SapBERT)与 OKF 模型(如 PubMedBERT)的相对性能如何?

主要发现

  • 句子 BERT 模型在所有四个评估数据集上均持续优于其对应的标准 BERT 模型。
  • 表现最佳的模型是基于 SapBERT 微调并使用 UMLS 关系进行精炼的句子 BERT,其在所有数据集上均取得最高分。
  • EHR-RelB 数据集(包含 89% 的多词概念)表现出最大挑战,但混合方法仍实现了强劲性能。
  • 通过 UMLS 关系进行精炼显著提升了嵌入质量,尤其对罕见或复杂的生物医学术语效果明显。
  • 该混合方法在包括临床记录和研究文献在内的多种生物医学文本类型中表现出鲁棒性和泛化能力。
  • 通过精炼整合本体知识显著提升了相关性得分,证实其在语义建模中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。