Skip to main content
QUICK REVIEW

[論文レビュー] Enriching Consumer Health Vocabulary Using Enhanced GloVe Word Embedding

Mohammed Ibrahim, Susan Gauch|arXiv (Cornell University)|Mar 31, 2020
Natural Language Processing Techniques参考文献 8被引用数 11
ひとこと要約

本稿では、既存の消費者健康用語語彙(CHV)語彙からの反復的フィードバックを活用して、消費者が生成したソーシャルメディアテキストから新しい平易な言語の健康用語を生成する、拡張されたGloVe単語埋め込み手法を提案する。真のCHV語彙を用いて単語埋め込みを精錬することで、一般向けの用語の検出が向上し、標準GloVeを上回り、かつCHVにまだ存在しない新しい用語を同定する。これにより、患者中心の健康用語が豊かになる。

ABSTRACT

Open-Access and Collaborative Consumer Health Vocabulary (OAC CHV, or CHV for short), is a collection of medical terms written in plain English. It provides a list of simple, easy, and clear terms that laymen prefer to use rather than an equivalent professional medical term. The National Library of Medicine (NLM) has integrated and mapped the CHV terms to their Unified Medical Language System (UMLS). These CHV terms mapped to 56000 professional concepts on the UMLS. We found that about 48% of these laymen's terms are still jargon and matched with the professional terms on the UMLS. In this paper, we present an enhanced word embedding technique that generates new CHV terms from a consumer-generated text. We downloaded our corpus from a healthcare social media and evaluated our new method based on iterative feedback to word embedding using ground truth built from the existing CHV terms. Our feedback algorithm outperformed unmodified GLoVe and new CHV terms have been detected.

研究の動機と目的

  • 消費者健康語彙(CHV)語彙の約半数が、一般向けを意図しているにもかかわらず依然として専門用語と見なされるという限界を是正すること。
  • 健康関連のソーシャルメディアにおける消費者生成テキストから、自動的に新しい平易な言語の健康用語を発見する手法を開発すること。
  • 既存のCHV語彙からの反復的フィードバックを用いて単語埋め込みを強化し、意味的に関連する非専門用語の検出能力を向上させること。
  • 患者が実際に健康状態をどのように表現するかをよりよく反映する用語を同定・検証することで、CHVを拡充すること。

提案手法

  • 本手法は、消費者健康コーパス内の単語の基本的な埋め込み表現として、事前学習済みGloVeモデルを用いる。
  • フィードバックメカニズムが、既知のCHV語彙との意味的類似度(コサイン類似度を用いて)を組み込むことで、反復的に単語埋め込みを精錬する。
  • フィードバックループは、真のCHV語彙との近接度に基づき単語ベクトルを調整し、モデルが意味的に関連する新しい用語を検出する能力を向上させる。
  • 精錬された埋め込みから、意味的にCHV語彙に近いが、頻度が高く、専門用語性が低い語を、新しい候補用語として抽出する。
  • 検出された用語の臨床的関連性を検証するために、統合医療言語システム(UMLS)のマッピングを活用する。
  • 評価は、基準となるCHV語彙の一部をホールドアウトセットとして用い、強化モデルと標準GloVeの間で、新しいCHVに類似する用語を同定する性能を比較することで実施する。

実験結果

リサーチクエスチョン

  • RQ1単語埋め込みに対する反復的フィードバックは、消費者生成テキストにおける平易な言語の健康用語の検出を向上させ得るか?
  • RQ2強化GloVeモデルは、標準GloVeと比較して、新しい非専門用語の健康用語を同定する能力で優れているか?
  • RQ3強化モデルが同定した新しい用語のうち、どれくらいの割合が意味的に関連性があり、既存のCHV語彙と整合しているか?
  • RQ4患者の言語に近い用語を発見することで、消費者健康用語語彙の専門用語性をどれくらい低減できるか?
  • RQ5フィードバック機構は、言語的に単純かつ臨床的に意味のある用語へと単語埋め込みを的確に誘導できるか?

主な発見

  • 強化GloVeモデルは、消費者のソーシャルメディアテキストから新しい平易な言語の健康用語を検出する面で、標準GloVeを上回った。
  • フィードバック機構により、検出された用語の意味的関連性が顕著に向上し、新しい用語の同定精度が向上した。
  • 既存CHV語彙の約48%が依然として専門用語と見なされていたため、より自然な患者の言語に合わせた語彙の拡充が不可欠であることが示された。
  • 本手法は、元のCHVに存在しなかったが、既知の一般用語と意味的に整合する新しい候補用語を効果的に同定した。
  • 本手法は、言語的単純性と臨床的関連性の両面で、患者中心の用語を捉える能力が向上したことを示した。
  • 評価により、強化モデルが、患者が健康状態をどのように表現するかをよりよく反映する意味的で重複のない用語を検出できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。