Skip to main content
QUICK REVIEW

[論文レビュー] AWE-CM Vectors: Augmenting Word Embeddings with a Clinical Metathesaurus

Willie Boag, Hassan Kané|arXiv (Cornell University)|Dec 5, 2017
Topic Modeling参考文献 14被引用数 8
ひとこと要約

本稿では、UMLSメタザウロスの臨床的概念マッピングを語彙埋め込みに統合することで、臨床NLPにおける性能を向上させるAWE-CMベクトルを提案する。word2vecの文脈を隣接語にとどまらず、CUI(臨床ユニバーサル識別子)に拡張することで、臨床専門家の判断との相関が著しく向上し、医師がアノテートした類似度スコアと0.508のスピアマン相関を達成。これは、標準的なword2vecおよび非臨床的事前学習済みベクトルを上回る結果である。

ABSTRACT

In recent years, word embeddings have been surprisingly effective at capturing intuitive characteristics of the words they represent. These vectors achieve the best results when training corpora are extremely large, sometimes billions of words. Clinical natural language processing datasets, however, tend to be much smaller. Even the largest publicly-available dataset of medical notes is three orders of magnitude smaller than the dataset of the oft-used "Google News" word vectors. In order to make up for limited training data sizes, we encode expert domain knowledge into our embeddings. Building on a previous extension of word2vec, we show that generalizing the notion of a word's "context" to include arbitrary features creates an avenue for encoding domain knowledge into word embeddings. We show that the word vectors produced by this method outperform their text-only counterparts across the board in correlation with clinical experts.

研究の動機と目的

  • 小規模な学習コーパスに起因する標準的な語彙埋め込みの臨床NLPにおける性能の限界を解消すること。
  • UMLSメタザウロスからの専門家が検証済みの医療知識を統合することで、臨床環境における語ベクトルの質を向上させること。
  • word2vecにCUIベースの文脈を組み込むことで、臨床専門家との意味的類似度相関が向上することを実証すること。
  • 臨床評価ベンチマークで、テキストのみの学習済みベクトルおよび非臨床的事前学習済みベクトルを上回る、公開可能なドメイン強化型語彙埋め込みモデルを提供すること。

提案手法

  • word2vecフレームワークを拡張し、文脈を隣接語にとどまらず、UMLSメタザウロスからのCUI(臨床ユニバーサル識別子)にまで拡張する。
  • UMLSのMRCONデータベースからのマッピングを用いて、MIMIC-IIIの臨床ノートの各語に対して(語, CUI)ペアを構築する。
  • WORD2VECFというツール(任意の文脈特徴をサポート)を用い、標準的な語共起ペアに加えて(語, CUI)ペアの両方で語ベクトルを学習する。
  • 標準的な前処理を実施:動的文脈ウィンドウ(1〜8トークン)、希少語のサブサンプリング、および学習前の希少語削除。
  • 26.8億の語ベースおよび2億6570万のCUIベースの(語, コンテキスト)ペアを含む統合コーパスを用いて、AWE-CMモデルを学習する。
  • 専門家がアノテートした類似度データセットを用いて、AWE-CMをベースラインモデル(Google News語ベクトルおよびMIMICのみのword2vecベクトル)と比較する。

実験結果

リサーチクエスチョン

  • RQ1UMLS CUIマッピングを語彙埋め込みの学習に組み込むことで、臨床専門家の判断との整合性が向上するか?
  • RQ2CUIベースの文脈の組み込みが、臨床テキストにおける語ベクトルの意味的質に与える影響は何か?
  • RQ3AWE-CM手法は、テキストのみの語埋め込みおよび非臨床的事前学習済みベクトルを上回るか?
  • RQ4医療オントロジーからのドメイン知識は、臨床NLPにおけるデータ不足をどの程度緩和できるか?

主な発見

  • AWE-CMベクトルは、MiniMayoSRSデータセットにおける医師がアノテートした類似度判断と0.508のスピアマン相関を示し、MIMICのみのword2vecベースライン(0.442)を著しく上回った。
  • アノテーターのMiniMayoSRSリストでは、AWE-CMが0.514を達成し、MIMIC w2vベースラインの0.572およびGoogle Newsベースラインの0.302を上回った。
  • AWE-CMモデルは、すべての評価セットで臨床専門家との相関を向上させ、UMLSメタザウロス知識の統合による一貫した向上効果を示した。
  • この向上は、AWE-CMとMIMIC w2vモデルが同じ学習ツール(WORD2VECF)とコーパスを使用していることから、(語, CUI)文脈ペアの導入に起因する。
  • CUIペアによる学習データサイズの増加はわずか11%にとどまるが、ベクトルの意味的質が著しく向上しており、CUIの情報密度の高さが示された。
  • AWE-CMベクトルは、医師がアノテートした類似度において最も高い性能を示し、死亡予測や診断などの臨床下流タスクにおいて最も関連性が高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。