Skip to main content
QUICK REVIEW

[论文解读] CODER: Knowledge infused cross-lingual medical term embedding for term normalization

Zheng Yuan, Zhengyun Zhao|arXiv (Cornell University)|Nov 5, 2020
Biomedical Text Mining and Ontologies被引用 5
一句话总结

CODER 提出了一种基于医学知识图谱的对比学习框架,用于生成跨语言的医学术语嵌入,以实现术语归一化。通过利用统一医学语言系统(UMLS)的关系和三元组,它学习到语义丰富且对齐的表示,在零样本术语归一化、语义相似性和关系分类任务中均优于当前最先进(SOTA)的生物医学嵌入方法。

ABSTRACT

This paper proposes CODER: contrastive learning on knowledge graphs for cross-lingual medical term representation. CODER is designed for medical term normalization by providing close vector representations for different terms that represent the same or similar medical concepts with cross-lingual support. We train CODER via contrastive learning on a medical knowledge graph (KG) named the Unified Medical Language System, where similarities are calculated utilizing both terms and relation triplets from KG. Training with relations injects medical knowledge into embeddings and aims to provide potentially better machine learning features. We evaluate CODER in zero-shot term normalization, semantic similarity, and relation classification benchmarks, which show that CODERoutperforms various state-of-the-art biomedical word embedding, concept embeddings, and contextual embeddings. Our codes and models are available at https://github.com/GanjinZero/CODER.

研究动机与目标

  • 为解决低资源环境下跨语言医学术语归一化的挑战。
  • 通过整合医学知识图谱中的结构化知识,改进医学术语的语义表示。
  • 通过共享向量空间实现跨语言医学术语归一化的零样本迁移学习。
  • 通过整合来自 UMLS 的关系信息,提升生物医学词嵌入的质量。

提出的方法

  • CODER 采用对比学习优化嵌入,通过最大化跨语言语义相关医学术语之间的相似性。
  • 利用统一医学语言系统(UMLS)知识图谱中的术语和关系三元组构建正样本对。
  • 通过最小化正样本对之间的对比损失,同时最大化负样本对之间的对比损失,学习联合表示。
  • 同时整合术语级和关系级信号,以丰富嵌入空间中的语义特征。
  • 训练过程利用多句和多跳关系模式,以提升在多样化医学概念上的泛化能力。
  • 最终嵌入通过在术语归一化、相似性和关系分类基准上的零样本迁移进行评估。

实验结果

研究问题

  • RQ1在医学知识图谱上进行对比学习能否提升跨语言医学术语表示的归一化性能?
  • RQ2从 UMLS 注入关系知识在多大程度上影响了生物医学词嵌入的质量?
  • RQ3所提出的模型在无需微调的情况下,能在多大程度上实现跨语言的零样本术语归一化?
  • RQ4术语与关系信号的整合是否能带来更好的语义相似性和关系分类性能?
  • RQ5CODER 在下游任务中与当前最先进(SOTA)的生物医学和上下文嵌入方法相比表现如何?

主要发现

  • CODER 在多种语言的零样本医学术语归一化任务中达到最先进性能,优于现有生物医学词嵌入和上下文模型。
  • 该模型在语义相似性任务中表现出显著提升,表明语义相关医学术语在嵌入空间中的对齐能力得到增强。
  • 在关系分类任务中,CODER 的 F1 分数高于基线模型,证实其关系推理能力得到增强。
  • 整合 UMLS 关系三元组显著提升了嵌入质量,尤其在低资源跨语言设置下表现突出。
  • CODER 的对比学习目标有效捕捉了跨语言间的语义和句法差异,实现了稳健的零样本迁移。
  • 该模型在所有评估基准上均表现出一致的优越性能,验证了通过对比学习注入知识的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。