Skip to main content
QUICK REVIEW

[論文レビュー] The MeSH-gram Neural Network Model: Extending Word Embedding Vectors with MeSH Concepts for UMLS Semantic Similarity and Relatedness in the Biomedical Domain

Saïd Abdeddaïm, Sylvestre Vimard|arXiv (Cornell University)|Nov 28, 2018
Topic Modeling参考文献 41被引用数 8
ひとこと要約

本稿では、PubMed MEDLINE上で訓練する際に単語の代わりにMedical Subject Headings (MeSH)記述語を用いることでスキップグラム単語埋め込みを拡張するニューラルネットワークモデル、MeSH-gramを紹介する。このモデルは、ベンチマークデータセットにおいて、標準的なスキップグラムと比較して優れた意味的類似度性能を達成し、外部リソースを必要とせず、計算コストも低く抑えられる。

ABSTRACT

Eliciting semantic similarity between concepts in the biomedical domain remains a challenging task. Recent approaches founded on embedding vectors have gained in popularity as they risen to efficiently capture semantic relationships The underlying idea is that two words that have close meaning gather similar contexts. In this study, we propose a new neural network model named MeSH-gram which relies on a straighforward approach that extends the skip-gram neural network model by considering MeSH (Medical Subject Headings) descriptors instead words. Trained on publicly available corpus PubMed MEDLINE, MeSH-gram is evaluated on reference standards manually annotated for semantic similarity. MeSH-gram is first compared to skip-gram with vectors of size 300 and at several windows contexts. A deeper comparison is performed with tewenty existing models. All the obtained results of Spearman's rank correlations between human scores and computed similarities show that MeSH-gram outperforms the skip-gram model, and is comparable to the best methods but that need more computation and external resources.

研究の動機と目的

  • 臨床および研究文書における生物医学的概念間の意味的類似度を測定する課題に対処すること。
  • UMLSメタテーザウリウスを介した構造化された生物医学用語を組み込むことで、既存の単語埋め込みモデルを改善すること。
  • 外部知識ベースや過度な計算に依存せずに、意味的類似度および関連性タスクで高いパフォーマンスを達成する手法を開発すること。
  • 人間がアノテートした類似度スコアを用いて、標準的なベンチマークと比較してモデルを評価すること。

提案手法

  • MeSH-gramモデルは、PubMed MEDLINE上で訓練する際に単語をその対応するMeSH記述語に置き換えることで、スキップグラムアーキテクチャを変更する。
  • 各訓練インスタンスでは、中心単語としてMeSH記述語を、スライディングウィンドウ内の周囲のMeSH記述語を文脈単語として使用する。
  • 確率的勾配降下法を用いて、文脈MeSH記述語を予測する尤度を最大化するように、MeSH用語の密なベクトル表現を学習する。
  • 学習されたMeSH記述語ベクトルから単語埋め込みが導出され、生物医学的概念間の意味的類似度計算が可能になる。
  • 標準的なベンチマークデータセットにおける人間がアノテートした類似度スコアと比較して、スピアマンの順位相関を用いてモデルを評価する。
  • 比較評価には、300次元のベクトルを用いたスキップグラムと、20の既存の最先端モデルが含まれる。

実験結果

リサーチクエスチョン

  • RQ1スキップグラムフレームワーク内で単語をMeSH記述語に置き換えることで、生物医学分野における意味的類似度性能が向上するか?
  • RQ2MeSH-gramは、標準的なスキップグラムおよび他の最先端モデルと比較して、人間の判断との意味的類似度相関においてどのように差をつけるか?
  • RQ3MeSH記述語の使用が、外部知識や複雑なアーキテクチャの必要性をどの程度低減するか?
  • RQ4モデルは、計算およびリソース要件を最小限に抑えつつも、強力なパフォーマンスを維持できるか?

主な発見

  • MeSH-gramは、テストされたすべてのウィンドウサイズにおいて、300次元のベクトルを用いた標準的なスキップグラムモデルを顕著に上回る性能を示した。
  • 外部リソースや複雑なトレーニングパイプラインを必要としないにもかかわらず、最高の既存手法と同等のスピアマン相関スコアを達成した。
  • MeSH-gramは、意味的類似度および関連性タスクのベンチマークデータセットにおいて強力なパフォーマンスを示しており、生物医学的意味関係を効果的に捉えていることが示された。
  • 追加の言語的特徴や知識ベースの特徴に依存するより複雑なアーキテクチャと比較しても、モデルのパフォーマンスは競争力を持つままであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。