[論文レビュー] A Hybrid Approach to Measure Semantic Relatedness in Biomedical Concepts
本稿では、生物医学的概念間の意味的類似度測定を向上させるために、Sentence BERTモデルとリトロフィットのハイブリッド手法を提案する。SNLIおよびSTSbデータセット上で微調整されたSentence BERT(特にSapBERT)を用い、UMLSオントロジーの関係をリトロフィットによって統合することで、4つのベンチマークデータセット(特に多語彙のEHR-RelBデータセット)において最先端の性能を達成し、標準的なBERTモデルを上回った。
Objective: This work aimed to demonstrate the effectiveness of a hybrid approach based on Sentence BERT model and retrofitting algorithm to compute relatedness between any two biomedical concepts. Materials and Methods: We generated concept vectors by encoding concept preferred terms using ELMo, BERT, and Sentence BERT models. We used BioELMo and Clinical ELMo. We used Ontology Knowledge Free (OKF) models like PubMedBERT, BioBERT, BioClinicalBERT, and Ontology Knowledge Injected (OKI) models like SapBERT, CoderBERT, KbBERT, and UmlsBERT. We trained all the BERT models using Siamese network on SNLI and STSb datasets to allow the models to learn more semantic information at the phrase or sentence level so that they can represent multi-word concepts better. Finally, to inject ontology relationship knowledge into concept vectors, we used retrofitting algorithm and concepts from various UMLS relationships. We evaluated our hybrid approach on four publicly available datasets which also includes the recently released EHR-RelB dataset. EHR-RelB is the largest publicly available relatedness dataset in which 89% of terms are multi-word which makes it more challenging. Results: Sentence BERT models mostly outperformed corresponding BERT models. The concept vectors generated using the Sentence BERT model based on SapBERT and retrofitted using UMLS-related concepts achieved the best results on all four datasets. Conclusions: Sentence BERT models are more effective compared to BERT models in computing relatedness scores in most of the cases. Injecting ontology knowledge into concept vectors further enhances their quality and contributes to better relatedness scores.
研究の動機と目的
- 生物医学的概念間の意味的類似度測定を改善すること、特に臨床文書に一般的な多語彙語句の取り扱いを強化すること。
- 標準的なBERTモデルが複雑な生物医学的概念のフレーズレベルの意味を捉える能力に限界があることを是正すること。
- UMLSのような構造化されたオントロジー知識を文脈に適応した単語埋め込みに統合することで、埋め込み品質を向上させること。
- 最近リリースされたEHR-RelB(多語彙語句に重点を置く)を含む、多様で公開済みのデータセット上で提案手法を評価すること。
- Sentence BERTが生物医学的文脈における意味的類似度モデリングにおいて、標準的なBERTを上回ることを示すこと。
提案手法
- SNLIおよびSTSbデータセット上でSiameseネットワークを用いて、文レベルの意味的表現を学習するため、Sentence BERTモデル(例:SapBERT)を微調整する。
- ELMo、BERT、Sentence BERTモデル(ドメイン適応のためのBioELMoおよびClinical ELMoを含む)を用いて、概念ベクトルを生成する。
- UMLS関係を統合するOntology Knowledge Injected(OKI)モデル(例:SapBERT、CoderBERT、KbBERT、UmlsBERT)を訓練する。
- 事前学習済みの概念ベクトルにUMLSベースのオントロジー知識をリトロフィットアルゴリズムで統合し、意味的整合性を向上させる。
- 比較のためのベースライン埋め込みとして、複数の生物医学的事前学習モデル(例:PubMedBERT、BioBERT、BioClinicalBERT)を用いる。
- EHR-RelB(全89%が多語彙語句を含む)を含む4つのデータセット上でハイブリッド手法を評価し、耐久性を検証する。
実験結果
リサーチクエスチョン
- RQ1標準的なBERTモデルの代わりにSentence BERTを使用することで、生物医学的概念の意味的類似度スコアが向上するか?
- RQ2UMLSオントロジー関係を用いたリトロフィットは、類似度タスクのための概念埋め込み品質を向上させられるか?
- RQ3EHR-RelBのように多語彙生物医学語句の割合が高いデータセットにおいて、ハイブリッド手法の性能はいかがなっているか?
- RQ4微調整済みSentence BERTとUMLSリトロフィットの組み合わせは、単体のモデルよりも効果的か?
- RQ5リトロフィットを施した場合、OKIモデル(例:SapBERT)とOKFモデル(例:PubMedBERT)の相対的性能はどのようになるか?
主な発見
- Sentence BERTモデルは、全4つの評価データセットにおいて、それに対応する標準的なBERTモデルを一貫して上回った。
- 最も優れた性能を示したのは、SapBERTで微調整されたSentence BERTで、UMLS関係をリトロフィット処理したモデルであり、全データセットで最高スコアを記録した。
- 89%が多語彙語句を含むEHR-RelBデータセットは最大の挑戦であったが、ハイブリッド手法は依然として高い性能を示した。
- UMLS関係を用いたリトロフィットは、希少または複雑な生物医学的語句において、埋め込み品質を顕著に向上させた。
- ハイブリッド手法は、臨床ノートや研究文書を含む多様な生物医学的テキストタイプにおいて、耐久性と一般化能力を示した。
- リトロフィットによるオントロジー知識の統合により、類似度スコアに測定可能な向上が見られ、意味的モデリングにおける価値が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。