Skip to main content
QUICK REVIEW

[論文レビュー] Retrofitting Concept Vector Representations of Medical Concepts to Improve Estimates of Semantic Similarity and Relatedness

Zhiguo Yu, Byron Wallace|PubMed|Sep 21, 2017
Biomedical Text Mining and Ontologies参考文献 13被引用数 18
ひとこと要約

本稿では、UMLSメタテーザウスの構造的知識を用いて分布的概念ベクトルをリノーティングすることで、生物学的分野における意味的類似性および類縁性推定を向上させる手法を提案する。UMLS関係にベクトル表現を整合させることで、UMNSRSベンチマークにおける人間の判断との相関が顕著に向上し、先行する最先端手法を上回る性能を発揮する。

ABSTRACT

Estimation of semantic similarity and relatedness between biomedical concepts has utility for many informatics applications. Automated methods fall into two categories: methods based on distributional statistics drawn from text corpora, and methods using the structure of existing knowledge resources. Methods in the former category disregard taxonomic structure, while those in the latter fail to consider semantically relevant empirical information. In this paper, we present a method that retrofits distributional context vector representations of biomedical concepts using structural information from the UMLS Metathesaurus, such that the similarity between vector representations of linked concepts is augmented. We evaluated it on the UMNSRS benchmark. Our results demonstrate that retrofitting of concept vector representations leads to better correlation with human raters for both similarity and relatedness, surpassing the best results reported to date. They also demonstrate a clear improvement in performance on this reference standard for retrofitted vector representations, as compared to those without retrofitting.

研究の動機と目的

  • 分布的ベクトルモデルが生物医学的概念の分類的構造を捉えることの限界を解決すること。
  • 事前学習済みの概念埋め込みにUMLSメタテーザウスからの構造的知識を統合すること。
  • ベクトル表現のヒトがアノテートした意味的類似性および類縁性判断との整合性を向上させること。
  • 生物医学的概念類似性の標準的ベンチマークであるUMNSRS上でリノーティングの有効性を評価すること。
  • 分布統計と知識グラフ構造を組み合わせることで、意味表現の質が向上することを示すこと。

提案手法

  • 本手法は、UMLSメタテーザウスを構造的関係のソースとして用いて、事前学習済みの分布的文脈ベクトルをリノーティングする。
  • 各概念のベクトルを、メタテーザウス内の意味的に関連する隣接概念とより類似するように調整する重み付き平均化プロセスを適用する。
  • リノーティングプロセスは、元のベクトルと隣接ベクトルの平均値の線形結合を用い、学習可能な重みパラメータを有する。
  • 本手法は、分布的意味論を保持するとともに、UMLSからの階層的および関係的構造を統合する。
  • 最終的なベクトルは、ヒトがアノテートしたベンチマークでの類似性推定を改善するように最適化される。
  • 本手法は、生物医学的概念の類似性および類縁性スコアをヒトがアノテートしたUMNSRSデータセットを用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1UMLSメタテーザウスの構造を用いた分布的概念ベクトルのリノーティングは、意味的類似性推定を向上させることができるか?
  • RQ2生物医学的知識グラフからの構造的知識を統合することで、分布的モデルを上回る類縁性推定が可能になるか?
  • RQ3リノーティングされたベクトルの性能は、UMNSRSベンチマークで最先端手法と比較してどうなるか?
  • RQ4語彙的および構造的情報の統合が、ヒトの判断との整合性をどの程度向上させるか?
  • RQ5リノーティングされたベクトルを用いることで、ヒトレーティングとの相関に測定可能な向上が見られるか?

主な発見

  • リノーティング手法は、これまで報告されたあらゆる手法よりも、UMNSRSベンチマークにおけるヒトレーティングとの相関を高めている。
  • 本手法は、意味的類似性および類縁性推定の両方を顕著に向上させ、これまでに報告された最高の結果を上回っている。
  • 標準的なUMNSRS評価セットにおいて、リノーティング済みベクトルは非リノーティングベクトルよりも明確な性能向上を示している。
  • 本手法は、経験的分布的統計を捨てることなく、UMLSからの構造的知識を効果的に分布的ベクトルに統合している。
  • 結果から、分布的および構造的情報の統合が、生物学的分野におけるより正確でヒトに近い意味表現を生み出すことが示された。
  • 改善効果は、類似性および類縁性の両タスクにわたり一貫しており、本手法の広範な有効性が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。