[论文解读] Truveta Mapper: A Zero-shot Ontology Alignment Framework
Truveta Mapper 提出了一种零样本、多任务的序列到序列变换器框架,将本体匹配视为翻译任务,将源本体节点映射到目标本体路径。该方法在无需后处理或标注数据的情况下,实现了最先进性能,推理复杂度为对数线性,优于 BERTMap 和 LogMap 等 SOTA 方法在 UMLS 基准测试中的表现。
In this paper, a new perspective is suggested for unsupervised Ontology Matching (OM) or Ontology Alignment (OA) by treating it as a translation task. Ontologies are represented as graphs, and the translation is performed from a node in the source ontology graph to a path in the target ontology graph. The proposed framework, Truveta Mapper (TM), leverages a multi-task sequence-to-sequence transformer model to perform alignment across multiple ontologies in a zero-shot, unified and end-to-end manner. Multi-tasking enables the model to implicitly learn the relationship between different ontologies via transfer-learning without requiring any explicit cross-ontology manually labeled data. This also enables the formulated framework to outperform existing solutions for both runtime latency and alignment quality. The model is pre-trained and fine-tuned only on publicly available text corpus and inner-ontologies data. The proposed solution outperforms state-of-the-art approaches, Edit-Similarity, LogMap, AML, BERTMap, and the recently presented new OM frameworks in Ontology Alignment Evaluation Initiative (OAEI22), offers log-linear complexity, and overall makes the OM task efficient and more straightforward without much post-processing involving mapping extension or mapping repair. We are open sourcing our solution.
研究动机与目标
- 通过将本体匹配视为从源本体节点到目标本体路径的翻译任务,解决无监督本体匹配的挑战。
- 通过实现零样本学习和预测,减少对人工标注的跨本体映射的依赖。
- 通过在多个本体之间利用统一的端到端框架进行迁移学习,提升效率和准确性。
- 通过联合建模文本语义和本体图结构,克服词汇和非上下文方法的局限性。
- 消除对后处理步骤(如映射扩展或修复)的需求,简化生产环境的部署。
提出的方法
- 将本体表示为图结构,并将本体匹配形式化为序列到序列的翻译任务,其中源类被翻译为目标本体中的分层路径。
- 采用在公开文本语料和本体内数据上预训练的多任务序列到序列变换器模型,通过掩码语言建模(MLM)学习语义和结构表示。
- 使用类别标签和同义词作为输入,以分层 ID 作为输出进行微调,以捕捉本体结构和语义等价性。
- 采用字节级分词以增强在不同分词方案下的鲁棒性,并提升泛化能力。
- 采用混合预测策略,结合图搜索与嵌入表示的语义相似度,提升对贪婪解码的鲁棒性。
- 通过避免在整个目标本体上进行二次相似度计算,实现对数线性推理复杂度,与 BERTMap 等模型不同。
实验结果
研究问题
- RQ1本体匹配能否被有效重构为本体图之间的零样本翻译任务?
- RQ2统一的多任务变换器模型能否在无需人工对齐数据的情况下,学习跨多样化本体的语义意义和结构层次?
- RQ3在文本和结构特征上进行联合预训练,是否能带来相比仅关注词汇或语义相似度的模型更优的对齐性能?
- RQ4该框架能否在实现对数线性推理复杂度的同时,达到最先进性能,避免基于相似度方法的二次方成本?
- RQ5该模型在无需任务特定微调的情况下,对不同本体对(如 SNOMED 到 FMA、SNOMED 到 NCIT)的泛化能力如何?
主要发现
- 在 SNOMED(Body)到 FMA 任务中,Truveta Mapper(TM)的 F-score 达到 0.950,比第二名方法(AML)高出 2.3 个百分点。
- 在 SNOMED(Pharm)到 NCIT 任务中,TM 的 F-score 达到 0.802,较 AMD 和 BERTMap-Lite 提高了 11.0 个百分点。
- 在 SNOMED(Neoplas)到 NCIT 任务中,TM 的 F-score 达到 0.792,较 BERTMap-Lite 和 Edit-Similarity 提高了 4.3 个百分点。
- TM 在 Body 任务中实现了 0.987 的平均倒数排名(MRR),优于所有基线模型,包括 BERTMap(0.919)和 LogMap(0.820)。
- Hit@1 得分在 Body 任务中达到 0.982,表明在 top-1 预测中具有高精度,显著超过 Edit-Similarity(0.760)和 LogMap(0.695)。
- 通过避免在目标本体上进行完整的相似度计算,将推理复杂度从二次方降低到对数线性,实现了可扩展的部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。