Skip to main content
QUICK REVIEW

[论文解读] Enriching Consumer Health Vocabulary Using Enhanced GloVe Word Embedding

Mohammed Ibrahim, Susan Gauch|arXiv (Cornell University)|Mar 31, 2020
Natural Language Processing Techniques参考文献 8被引用 11
一句话总结

本文提出了一种增强版的GloVe词嵌入方法,通过利用现有患者健康词汇表(CHV)术语的迭代反馈,从消费者生成的社交媒体文本中生成新的、通俗易懂的健康术语。通过使用真实CHV术语对词嵌入进行精炼,该方法提升了对适合普通大众的健康词汇的检测能力,优于标准GloVe模型,并识别出CHV中此前未包含的新术语,从而丰富了以患者为中心的健康术语体系。

ABSTRACT

Open-Access and Collaborative Consumer Health Vocabulary (OAC CHV, or CHV for short), is a collection of medical terms written in plain English. It provides a list of simple, easy, and clear terms that laymen prefer to use rather than an equivalent professional medical term. The National Library of Medicine (NLM) has integrated and mapped the CHV terms to their Unified Medical Language System (UMLS). These CHV terms mapped to 56000 professional concepts on the UMLS. We found that about 48% of these laymen's terms are still jargon and matched with the professional terms on the UMLS. In this paper, we present an enhanced word embedding technique that generates new CHV terms from a consumer-generated text. We downloaded our corpus from a healthcare social media and evaluated our new method based on iterative feedback to word embedding using ground truth built from the existing CHV terms. Our feedback algorithm outperformed unmodified GLoVe and new CHV terms have been detected.

研究动机与目标

  • 为解决近一半的患者健康词汇表(CHV)术语仍被视为术语,尽管其初衷是面向普通大众的这一局限性。
  • 开发一种自动从医疗社交媒体中的消费者生成文本中发现新通俗语言健康术语的方法。
  • 通过利用现有CHV术语的迭代反馈来增强词嵌入,以提高对有意义且非术语化通俗术语的检测能力。
  • 通过识别并验证更能反映患者实际描述健康状况方式的新术语,来丰富CHV。

提出的方法

  • 该方法以预训练的GloVe模型作为消费者健康语料中词语的基础嵌入表示。
  • 通过使用余弦相似度将新术语与已知CHV术语对齐,反馈机制迭代地通过已知CHV术语的语义相似性来优化词嵌入。
  • 反馈循环根据与真实CHV术语的接近程度调整词向量,从而增强模型检测语义相关新术语的能力。
  • 通过识别在社交媒体语料中频率较高且非术语化的词语,并且与CHV术语语义接近的词语,从精炼后的嵌入中提取新候选术语。
  • 该方法利用统一医学语言系统(UMLS)映射来验证所检测术语的临床相关性。
  • 通过将增强模型与标准GloVe在已知CHV术语作为参考的保留数据集上的表现进行比较,开展评估。

实验结果

研究问题

  • RQ1对词嵌入进行迭代反馈是否能提升在消费者生成文本中检测通俗语言健康术语的能力?
  • RQ2与标准GloVe相比,增强版GloVe模型在识别新非术语化健康术语方面表现如何?
  • RQ3增强模型识别出的新术语中,有多大比例在语义上相关并符合现有CHV术语?
  • RQ4该方法在多大程度上能通过发现更贴近患者语言的术语来减少患者健康词汇中的术语化程度?
  • RQ5该反馈机制是否能有效引导词嵌入朝向语言上简单且临床意义明确的术语?

主要发现

  • 增强版GloVe模型在从消费者社交媒体文本中检测新通俗语言健康术语方面优于标准GloVe模型。
  • 反馈机制显著提高了所检测术语的语义相关性,提升了新术语发现的精确度。
  • 约48%的现有CHV术语仍被认为属于术语,凸显了需通过更自然的患者语言来丰富CHV的必要性。
  • 该方法成功识别出原始CHV中不存在但与已知通俗术语语义一致的新候选术语。
  • 该方法在捕捉以患者为中心的术语方面表现出更优性能,尤其体现在语言简洁性和临床相关性方面。
  • 评估结果证实,增强模型能够检测出有意义且不冗余的术语,更准确地反映患者描述健康状况的方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。