Skip to main content
QUICK REVIEW

[論文レビュー] Clinical Concept Embeddings Learned from Massive Sources of Medical Data.

Andrew L. Beam, Benjamin Kompa|arXiv (Cornell University)|Apr 4, 2018
Biomedical Text Mining and Ontologies被引用数 28
ひとこと要約

本論文では、6000万件の保険請求書、2000万件の臨床ノート、170万件の生物医学ジャーナル論文を統合した大規模なデータベースを用いて、GloVeおよびword2vecアルゴリズムを活用し、108,477の医療概念の臨床的概念埋め込みを学習する cui2vec を提案する。この手法は臨床ベンチマークで最先端の性能を達成し、一般公開用の事前学習済み埋め込みとインタラクティブツールを提供する。

ABSTRACT

Word embeddings have emerged as a popular approach to unsupervised learning of word relationships in machine learning and natural language processing. In this article, we benchmark two of the most popular algorithms, GloVe and word2vec, to assess their suitability for capturing medical relationships in large sources of biomedical data. Leaning on recent theoretical insights, we provide a unified view of these algorithms and demonstrate how different sources of data can be combined to construct the largest ever set of embeddings for 108,477 medical concepts using an insurance claims database of 60 million members, 20 million clinical notes, and 1.7 million full text biomedical journal articles. We evaluate our approach, called cui2vec, on a set of clinically relevant benchmarks and in many instances demonstrate state of the art performance relative to previous results. Finally, we provide a downloadable set of pre-trained embeddings for other researchers to use, as well as an online tool for interactive exploration of the cui2vec embeddings.

研究の動機と目的

  • GloVeおよびword2vecが大規模な生物医学データにおいて医療関係を的確に捉える適性を評価すること。
  • 多様なデータソースを統合することで、これまでにない規模の臨床的概念埋め込み(108,477概念)の構築。
  • cui2vecを臨床的に関連するタスクでベンチマーク化し、先行手法と比較して優れた性能を示すこと。
  • 再現性と広範な研究利用を支援するため、事前学習済み埋め込みとインタラクティブツールの公開。

提案手法

  • 著者らは、保険請求書、臨床ノート、および全文生物医学論文を統合したコーパスにGloVeおよびword2vecアルゴリズムを適用する。
  • 理論的知見を活用して2つのアルゴリズムを統合し、異種のデータソース間で一貫した学習を可能にする。
  • 臨床ユニバーサル識別子(CUI)でインデックス化された108,477の医療概念の密なベクトル表現(埋め込み)をモデルが学習する。
  • 6000万人分のデータ、2000万件の臨床ノート、170万件のジャーナル論文のデータが集約され、事前処理されて学習に使用される。
  • ネガティブサンプリングを最適化手法として用い、スイップグラムおよび連続的バッグオブワーズアーキテクチャを用いて、エンドツーエンドで埋め込みを学習する。
  • 得られた cui2vec モデルは臨床ベンチマークで評価され、ダウンロード可能なデータセットおよびインタラクティブ可視化ツールとともに公開される。

実験結果

リサーチクエスチョン

  • RQ1GloVeおよびword2vecは、多様な生物医学データソースから意味的な医療概念表現を効果的に学習できるか?
  • RQ2請求書データ、臨床ノート、および全文論文を統合することで、臨床埋め込みの質とカバレッジがどのように向上するか?
  • RQ3cui2vecモデルは、臨床的に関連する下流タスクにおいて、既存の手法を上回る性能を示すか?
  • RQ4学習された埋め込みが、臨床的に関連する意味的・構文的関係をどの程度正確に捉えているか?

主な発見

  • cui2vecモデルは、複数の臨床的に関連するベンチマークで最先端の性能を達成し、先行手法を上回る。
  • 請求書データ、臨床ノート、および全文論文の統合により、108,477の医療概念における埋め込みのカバレッジと質が顕著に向上した。
  • ベンチマークタスクでの検証により、モデルが医療概念間の意味的関係を強く捉えていることが示された。
  • 事前学習済みの cui2vec 埋め込みは、一般公開されており、多様な生物医学NLPアプリケーションでの再利用が可能である。
  • リアルタイムで cui2vec 埋め込み内の意味的関係を探索できるインタラクティブなオンラインツールが提供されている。
  • GloVeおよびword2vecの統合フレームワークにより、大規模で異種の医療テキストソース間で一貫性がありスケーラブルな学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。