Skip to main content
QUICK REVIEW

[논문 리뷰] Scientific Language Models for Biomedical Knowledge Base Completion: An Empirical Study

Rahul Nadkarni, David Wadden|arXiv (Cornell University)|2021. 06. 17.
Topic Modeling참고 문헌 39인용 수 13
한 줄 요약

이 논문은 과학적 언어 모델(LMs)과 지식 그래프 임베딩(KGE) 모델을 통합하여 생물의학 지식 기반 완성에 활용하며, 예측값 간 동적으로 선택을 하는 학습 가능한 라우터를 사용한다. 이 방법은 기준 모델 대비 상대적 MRR 향상률 13–36%를 달성하고, 새로운 과학적 실체에 대한 일반화 능력이 뛰어나, 약물-질병 링크 예측에서 텍스트 및 그래프 모odalities의 상호보완적 강점을 입증한다.

ABSTRACT

Biomedical knowledge graphs (KGs) hold rich information on entities such as diseases, drugs, and genes. Predicting missing links in these graphs can boost many important applications, such as drug design and repurposing. Recent work has shown that general-domain language models (LMs) can serve as "soft" KGs, and that they can be fine-tuned for the task of KG completion. In this work, we study scientific LMs for KG completion, exploring whether we can tap into their latent knowledge to enhance biomedical link prediction. We evaluate several domain-specific LMs, fine-tuning them on datasets centered on drugs and diseases that we represent as KGs and enrich with textual entity descriptions. We integrate the LM-based models with KG embedding models, using a router method that learns to assign each input example to either type of model and provides a substantial boost in performance. Finally, we demonstrate the advantage of LM models in the inductive setting with novel scientific entities. Our datasets and code are made publicly available.

연구 동기 및 목표

  • 도메인 특화 과학적 언어 모델이 생물의학 지식 그래프 완성에 기여할 수 있는지 조사하기 위해
  • 언어 모델과 지식 그래프 임베딩 모델의 예측 강도 및 일반화 능력 측면에서 상호보완적 강점을 평가하기 위해
  • LM과 KGE 예측 간을 선택하는 라우터 기반 융합 방법을 개발하고 성능 향상을 평가하기 위해
  • 학습 중에 볼 수 없었던 실체에 대해 LMs의 유용성을 입증하기 위해
  • 재현 가능성과 향후 생물의학 지식 기반 완성 분야의 연구를 지원하기 위해 데이터셋과 코드를 공개하기 위해

제안 방법

  • 생물의학 지식 그래프에 과학적 문헌에서 추출한 실체 기술을 추가하여 풍부화한 후, 도메인 특화 과학적 언어 모델(LMs; 예: PubMedBERT, BioBERT)을 미세조정한다.
  • 동일한 지식 그래프에 대해 지식 그래프 임베딩 모델(KGE; 예: ComplEx, DKRL)을 학습시켜 구조적 표현을 학습한다.
  • 입력 특징에 기반해 각 입력 트리플을 LM 또는 KGE 모델에 할당하는 학습 가능한 라우터를 구현하여 예측 정확도를 향상시킨다.
  • 학습 중에 볼 수 없었던 실체의 임베딩을 교체하기 위해 동결 또는 미세조정된 LMs를 사용한 최근접 이웃 전략을 적용하여 인도적 추론을 가능하게 한다.
  • 양 모odalities의 예측을 라우팅을 통해 융합하여 단순 평균화나 조기 융합보다 우수한 성능을 달성한다.
  • 약물과 질병에 중심을 둔 세 개의 생물의학 지식 그래프를 구축하며, 과학 문헌에서 추출한 기술을 실체에 추가한다.

실험 결과

연구 질문

  • RQ1과학적 언어 모델이 생물의학 지식을 잠재적으로 포착하고 활용하여 지식 기반 완성에 효과적으로 기여할 수 있는가?
  • RQ2언어 모델의 예측이 지식 그래프 임베딩 모델의 예측 강도 및 일반화 능력 측면에서 상호보완적인가?
  • RQ3LM과 KGE 예측 간을 선택하는 학습 가능한 라우터가 고정된 앙상블 전략을 능가하는가?
  • RQ4학습 중에 볼 수 없었던 새로운 생물의학 실체에 대해 언어 모델의 일반화 능력은 얼마나 뛰어난가?
  • RQ5실체 기술과 텍스트 다양성은 링크 예측 성능 향상에 어떤 역할을 하는가?

주요 결과

  • 언어 모델과 지식 그래프 임베딩의 라우터 기반 융합은 세 개의 생물의학 지식 그래프에서 평균 역순위(MRR)에 대해 상대적 13–36% 향상률을 달성한다.
  • 미세조정된 PubMedBERT(KG-PubMedBERT)는 DKRL과 같은 일반 KGE 모델보다 우수하며, Hetionet에서는 21% 상대적 MRR 향상률을 기록하고, RepoDB에서는 2배 이상의 향상률을 기록한다.
  • 동결된 PubMedBERT를 사용한 최근접 이웃 전략으로 볼 수 없었던 실체 임베딩을 대체하면 DKRL보다 유사하거나 더 좋은 결과를 얻으며, 이는 LMs가 인도적 링크 예측에서의 유용성을 입증한다.
  • RepoDB(MRR 38.8)와 Hetionet(MRR 21.6)에서 뛰어난 성능을 기록하며, H@3 및 H@10 지표에서도 상당한 향상이 이루어졌다.
  • 복잡하거나 직관적이지 않은 이름을 가진 실체(예: P2RY14)에서는 언어 모델이 더 뛰어난 성능을 보였으며, 이는 텍스트 기술이 의미 해석을 도와주기 때문이다.
  • 라우터 모델은 LM과 KGE 예측의 단순 평균화보다 성능이 뛰어나며, 이는 동적 선택 전략이 고정된 융합 전략보다 더 효과적이라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.