Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid Approach to Measure Semantic Relatedness in Biomedical Concepts

Katikapalli Subramanyam Kalyan, S. Sangeetha|arXiv (Cornell University)|2021. 01. 25.
Topic Modeling참고 문헌 36인용 수 6
한 줄 요약

이 논문은 생물의학적 개념 간 의미 유사도 측정을 향상시키기 위해 문장 BERT 모델과 리트로핏팅을 조합한 하이브리드 방법을 제안한다. SNLI 및 STSb 데이터셋에서 문장 BERT(특히 SapBERT)를 미세조정하고 UMLS 온톨로지 관계를 리트로핏팅을 통해 통합함으로써, 다섯 가지 벤치마크 데이터셋에서 최고 성능을 기록하였으며, 특히 다단어로 구성된 과제가 많은 EHR-RelB 데이터셋에서도 표준 BERT 모델을 능가하였다.

ABSTRACT

Objective: This work aimed to demonstrate the effectiveness of a hybrid approach based on Sentence BERT model and retrofitting algorithm to compute relatedness between any two biomedical concepts. Materials and Methods: We generated concept vectors by encoding concept preferred terms using ELMo, BERT, and Sentence BERT models. We used BioELMo and Clinical ELMo. We used Ontology Knowledge Free (OKF) models like PubMedBERT, BioBERT, BioClinicalBERT, and Ontology Knowledge Injected (OKI) models like SapBERT, CoderBERT, KbBERT, and UmlsBERT. We trained all the BERT models using Siamese network on SNLI and STSb datasets to allow the models to learn more semantic information at the phrase or sentence level so that they can represent multi-word concepts better. Finally, to inject ontology relationship knowledge into concept vectors, we used retrofitting algorithm and concepts from various UMLS relationships. We evaluated our hybrid approach on four publicly available datasets which also includes the recently released EHR-RelB dataset. EHR-RelB is the largest publicly available relatedness dataset in which 89% of terms are multi-word which makes it more challenging. Results: Sentence BERT models mostly outperformed corresponding BERT models. The concept vectors generated using the Sentence BERT model based on SapBERT and retrofitted using UMLS-related concepts achieved the best results on all four datasets. Conclusions: Sentence BERT models are more effective compared to BERT models in computing relatedness scores in most of the cases. Injecting ontology knowledge into concept vectors further enhances their quality and contributes to better relatedness scores.

연구 동기 및 목표

  • 생물의학적 개념 간 의미 유사도 측정을 향상시키며, 특히 임상 텍스트에서 흔한 다단어 용어에 초점을 맞춘다.
  • 복잡한 생물의학적 개념에 대해 어휘 수준의 의미를 포착하지 못하는 표준 BERT 모델의 한계를 해결한다.
  • 구조화된 온톨로지 지식(UMLS)을 연속적 단어 임베딩에 통합하여 임베딩 품질을 향상시킨다.
  • 최근 공개된 EHR-RelB를 포함한 다양한 공개 데이터셋에서 제안된 방법을 평가한다. 이 데이터셋은 다단어 개념에 중점을 둔다.
  • 문장 BERT가 생물의학적 맥락에서 의미 유사도를 모델링하는 데 표준 BERT보다 뛰어난 성능을 보임을 입증한다.

제안 방법

  • SNLI 및 STSb 데이터셋에서 Siamese 네트워크를 사용해 문장 수준의 의미 표현을 학습하기 위해 문장 BERT 모델(예: SapBERT)을 미세조정한다.
  • ELMo, BERT 및 문장 BERT 모델을 사용해 개념 벡터를 생성하였으며, 도메인 적응을 위해 BioELMo와 Clinical ELMo도 포함하였다.
  • UMLS 관계를 통합하기 위해 Ontology Knowledge Injected (OKI) 모델(예: SapBERT, CoderBERT, KbBERT, UmlsBERT)을 훈련시켰다.
  • 사전 훈련된 개념 벡터에 UMLS 기반 온톨로지 지식을 리트로핏팅 알고리즘을 통해 통합하여 의미 일관성을 향상시켰다.
  • 비교를 위해 PubMedBERT, BioBERT, BioClinicalBERT 등의 다수의 생물의학 전처리 모델을 기준 임베딩으로 사용하였다.
  • EHR-RelB를 포함한 네 가지 데이터셋에서 하이브리드 접근법을 평가하였으며, 이 데이터셋은 다단어 개념 비율이 89%에 이르므로 복잡성 테스트에 적합하였다.

실험 결과

연구 질문

  • RQ1표준 BERT 모델 대비 문장 BERT 모델을 사용할 경우 생물의학적 개념에 대한 의미 유사도 점수가 향상되는가?
  • RQ2UMLS 온톨로지 관계를 기반으로 한 리트로핏팅이 관련성 작업을 위한 개념 임베딩 품질을 향상시킬 수 있는가?
  • RQ3EHR-RelB와 같이 다단어 생물의학적 용어 비율이 높은 데이터셋에서 하이브리드 접근법의 성능은 어떠한가?
  • RQ4미세조정된 문장 BERT와 UMLS 리트로핏팅의 조합이 단독 모델보다 더 효과적인가?
  • RQ5리트로핏팅을 통해 향상된 OKI 모델(예: SapBERT)과 OKF 모델(예: PubMedBERT) 간의 상대적 성능은 어떠한가?

주요 결과

  • 문장 BERT 모델은 모든 네 가지 평가 데이터셋에서 해당 표준 BERT 모델 대비 일관되게 뛰어난 성능을 보였다.
  • 가장 높은 점수를 기록한 모델은 SapBERT를 기반으로 하여 미세조정하고 UMLS 관계를 리트로핏팅한 문장 BERT 모델이었다.
  • 다단어 개념 비율이 89%에 이르는 EHR-RelB 데이터셋은 가장 큰 도전 과제였지만, 하이브리드 접근법은 여전히 뛰어난 성능을 기록하였다.
  • UMLS 관계를 기반으로 한 리트로핏팅은 희귀하거나 복잡한 생물의학적 용어의 경우 특히 임베딩 품질 향상에 뚜렷한 기여를 하였다.
  • 다양한 생물의학적 텍스트 유형(임상 기록, 연구 문헌 등)에 걸쳐 하이브리드 접근법은 뛰어난 강건성과 일반화 능력을 보였다.
  • 온톨로지 지식을 리트로핏팅을 통해 통합함으로써 관련성 점수에 측정 가능한 향상이 있었으며, 이는 의미 모델링에서의 가치를 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.