[论文解读] Learning Domain-Specialised Representations for Cross-Lingual Biomedical Entity Linking
本文提出了一项跨语言生物医学实体链接(XL-BEL)任务及基准,覆盖10种语言,引入了多语言自对齐预训练(SAP)的扩展,以将来自英语(通过UMLS)的领域特定知识迁移至低资源语言。结果表明,即使在没有领域内数据或平行语料的情况下,结合UMLS同义词与通用领域翻译数据,也能使泰语等低资源语言的性能提升高达20个Precision@1点。
Injecting external domain-specific knowledge (e.g., UMLS) into pretrained language models (LMs) advances their capability to handle specialised in-domain tasks such as biomedical entity linking (BEL). However, such abundant expert knowledge is available only for a handful of languages (e.g., English). In this work, by proposing a novel cross-lingual biomedical entity linking task (XL-BEL) and establishing a new XL-BEL benchmark spanning 10 topologically diverse languages, we first investigate the ability of standard knowledge-agnostic as well as knowledge-enhanced monolingual and multilingual LMs beyond the standard monolingual English BEL task. The scores indicate large gaps to English performance. We then address the challenge of transferring domain-specific knowledge in resource-rich languages to resource-poor ones. To this end, we propose and evaluate a series of cross-lingual transfer methods for the XL-BEL task, and demonstrate that general-domain bitext helps propagate the available English knowledge to languages with little to no in-domain data. Remarkably, we show that our proposed domain-specific transfer methods yield consistent gains across all target languages, sometimes up to 20 Precision@1 points, without any in-domain knowledge in the target language, and without any in-domain parallel data.
研究动机与目标
- 调查非英语语言在生物医学实体链接(BEL)方面与英语之间的性能差距。
- 建立一个涵盖10种类型多样的语言的新型跨语言BEL基准,用于评估多语言生物医学表示学习。
- 开发并评估将资源丰富语言(如英语)的领域特定知识迁移至资源匮乏语言的跨语言迁移方法。
- 证明通用领域翻译数据可显著提升生物医学知识在零样本跨语言迁移中的表现。
- 在无需目标语言领域内数据或平行单语语料的情况下,实现跨语言生物医学实体链接的最先进性能。
提出的方法
- 提出一种多语言自对齐预训练(SAP)的扩展方法,通过在多种语言(包括非英语)中使用UMLS同义词集对多语言模型进行微调。
- 引入一种三元组挖掘(锚点、正例、负例)的训练方案,以促使共享相同CUI的同义词在不同语言中获得相似的表示。
- 通过加权组合策略,将UMLS同义词与来自bitext的通用领域词和短语翻译相结合,增强SAP框架。
- 采用度量学习与对比损失,对齐跨语言同义术语的表示,同时保持其语义一致性。
- 评估XLM-RoBERTa和mBERT的基线与大模型变体,采用两阶段训练设置,结合UMLS同义词数据与翻译数据进行微调。
- 采用双分支架构,模型对提及词和候选实体进行编码,并计算相似度得分以预测正确的CUI。
实验结果
研究问题
- RQ1标准多语言语言模型(如mBERT和XLM-R)在未进行领域内微调的情况下,能否在跨语言生物医学实体链接任务上实现强性能?
- RQ2通过UMLS从英语中获得的领域特定知识,在跨语言生物医学NLP中能多大程度上被迁移至低资源语言?
- RQ3在低资源语言中,整合通用领域翻译数据是否能改善生物医学实体表示的跨语言对齐?
- RQ4不同组合的UMLS同义词集(如仅英语 vs. 多语言)如何影响跨语言迁移性能?
- RQ5在低资源设置下,结合知识注入后,XLM-RoBERTa LARGE等大模型是否能优于较小模型?
主要发现
- XLM-RoBERTa在完整UMLS同义词微调(SAPall syn)下,英语的Precision@1达到56.4%,10种语言的平均值为35.1%,显著优于原始mBERT和XLM-R。
- 对于UMLS中未涵盖的泰语(TH),使用SAPall syn结合通用领域翻译数据的模型在Precision@1上达到30.9%,相比基线提升19.4个百分点。
- 添加通用领域翻译数据后,部分语言的性能提升最高达12.7%,在俄语、土耳其语、韩语和泰语中提升超过10个百分点。
- 使用所有可用同义词数据(SAPall syn)的模型始终优于仅使用英语或特定语言同义词的变体,表明更广泛的同义词覆盖可增强迁移效果。
- XLM-RoBERTa LARGE在SAP微调后,英语的Precision@1达到78.3%,10种语言的平均值为39.0%,表明大模型在低资源设置下从知识注入中获益更多。
- 所提方法在XL-BEL上实现了最先进性能,且无需目标语言的领域内训练数据或平行单语数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。