Skip to main content
QUICK REVIEW

[논문 리뷰] The MeSH-gram Neural Network Model: Extending Word Embedding Vectors with MeSH Concepts for UMLS Semantic Similarity and Relatedness in the Biomedical Domain

Saïd Abdeddaïm, Sylvestre Vimard|arXiv (Cornell University)|2018. 11. 28.
Topic Modeling참고 문헌 41인용 수 8
한 줄 요약

이 논문은 PubMed MEDLINE에서 훈련하는 동안 단어를 의학적 주제어어(Medical Subject Headings, MeSH) 기술어로 대체함으로써 스킵그램 단어 임베딩을 확장한 신경망 모델인 MeSH-gram을 소개한다. 이 모델은 기준 데이터셋에서 우수한 의미 유사도 성능을 달성하며, 표준 스킵그램 모델을 뛰어넘고, 외부 자원이 필요 없고 계산 비용도 적은 최상위 수준의 방법과 비슷한 성능을 보인다.

ABSTRACT

Eliciting semantic similarity between concepts in the biomedical domain remains a challenging task. Recent approaches founded on embedding vectors have gained in popularity as they risen to efficiently capture semantic relationships The underlying idea is that two words that have close meaning gather similar contexts. In this study, we propose a new neural network model named MeSH-gram which relies on a straighforward approach that extends the skip-gram neural network model by considering MeSH (Medical Subject Headings) descriptors instead words. Trained on publicly available corpus PubMed MEDLINE, MeSH-gram is evaluated on reference standards manually annotated for semantic similarity. MeSH-gram is first compared to skip-gram with vectors of size 300 and at several windows contexts. A deeper comparison is performed with tewenty existing models. All the obtained results of Spearman's rank correlations between human scores and computed similarities show that MeSH-gram outperforms the skip-gram model, and is comparable to the best methods but that need more computation and external resources.

연구 동기 및 목표

  • 임상 및 연구 텍스트 내 생물의학적 개념 간의 의미 유사도 측정 과제를 해결하기 위해.
  • UMLS 메타테사우루스를 통한 구조화된 생물의학 용어를 MeSH 기술어를 통해 통합하여 기존의 단어 임베딩 모델을 향상시키기 위해.
  • 외부 지식 기반 시스템이나 과도한 계산 자원에 의존하지 않고도 의미 유사도 및 관련성 작업에서 높은 성능을 달성하는 방법을 개발하기 위해.
  • 수동으로 애너테이션된 유사도 점수를 기반으로 기준 데이터셋을 사용하여 모델 평가하기 위해.

제안 방법

  • MeSH-gram 모델은 PubMed MEDLINE에서 훈련하는 동안 단어를 해당하는 MeSH 기술어로 대체함으로써 스킵그램 아키텍처를 변형한다.
  • 각 훈련 인스턴스는 중심 단어로 MeSH 기술어를 사용하고, 슬라이딩 윈도우 내의 주변 MeSH 기술어를 맥락 단어로 사용한다.
  • 모델은 확률적 경사 하강법을 사용하여 맥락 MeSH 기술어를 예측할 확률을 최대화함으로써 MeSH 용어에 대한 조밀한 벡터 표현을 학습한다.
  • 학습된 MeSH 기술어 벡터에서 유도된 단어 임베딩을 통해 생물의학적 개념 간의 의미 유사도 계산이 가능해진다.
  • 모델는 표준 기준 데이터셋에서 수동으로 애너테이션된 인간의 유사도 점수와의 스피어만 상관계수를 사용하여 평가된다.
  • 비교 평가에는 300차원 벡터를 사용한 스킵그램과 기존의 20개의 최첨단 모델이 포함된다.

실험 결과

연구 질문

  • RQ1스킵그램 아키텍처에서 단어를 MeSH 기술어로 대체함으로써 생물의학 분야에서 의미 유사도 성능을 향상시킬 수 있는가?
  • RQ2MeSH-gram은 인간 판단과의 의미 유사도 상관계수 측면에서 표준 스킵그램 및 기타 최첨단 모델과 비교하여 어떻게 성능을 내는가?
  • RQ3MeSH 기술어를 사용함으로써 외부 지식 또는 복잡한 아키텍처에 대한 필요성이 얼마나 감소하는가?
  • RQ4모델는 외부 자원이나 계산 자원 요구량을 최소화하면서도 강력한 성능을 유지하는가?

주요 결과

  • MeSH-gram은 테스트된 모든 윈도우 크기에서 300차원 벡터를 사용한 표준 스킵그램 모델을 뚜렷이 뛰어넘는 성능을 보였다.
  • 외부 자원이나 복잡한 훈련 파이프라인 없이도 최고의 기존 방법과 비슷한 스피어만 상관계수 점수를 달성하였다.
  • MeSH-gram은 의미 유사도 및 관련성 작업을 위한 기준 데이터셋에서 강력한 성능을 보이며, 생물의학적 의미 관계를 효과적으로 포착하고 있음을 시사한다.
  • 추가적인 언어학적 또는 지식 기반 특징에 의존하는 더 복잡한 아키텍처와 비교해도 모델의 성능는 경쟁력이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.