Skip to main content
QUICK REVIEW

[论文解读] Word2Vec and Doc2Vec in Unsupervised Sentiment Analysis of Clinical Discharge Summaries

Qufei Chen, Marina Sokolova|arXiv (Cornell University)|May 1, 2018
Topic Modeling参考文献 9被引用 22
一句话总结

本研究采用无监督的Word2Vec和Doc2Vec模型,对无标注情感数据的临床出院总结进行情感分析。以SentiWordNet作为黄金标准,作者证明了Word2Vec与Doc2Vec具有互补性,可在真实、无标注的环境下提升临床文本的情感检测准确率。

ABSTRACT

In this study, we explored application of Word2Vec and Doc2Vec for sentiment analysis of clinical discharge summaries. We applied unsupervised learning since the data sets did not have sentiment annotations. Note that unsupervised learning is a more realistic scenario than supervised learning which requires an access to a training set of sentiment-annotated data. We aim to detect if there exists any underlying bias towards or against a certain disease. We used SentiWordNet to establish a gold sentiment standard for the data sets and evaluate performance of Word2Vec and Doc2Vec methods. We have shown that the Word2vec and Doc2Vec methods complement each other results in sentiment analysis of the data sets.

研究动机与目标

  • 开发一种无监督的临床出院总结情感分析方法,避免依赖昂贵的情感标注训练数据。
  • 评估Word2Vec和Doc2Vec在无显式情感标签情况下捕捉临床文本情感的能力。
  • 探究这些模型是否能够检测临床叙述中针对特定疾病的潜在情感偏倚。
  • 使用SentiWordNet作为参考标准,评估并比较Word2Vec和Doc2Vec在情感分类中的性能。
  • 确定结合Word2Vec和Doc2Vec是否能提升临床文本的情感检测准确率。

提出的方法

  • 将Word2Vec应用于从临床出院总结中学习单个词语的稠密向量表示。
  • 使用Doc2Vec生成捕捉整个出院总结整体情感的文档级嵌入。
  • 利用SentiWordNet作为预存在的情感词典,为词语和短语分配情感得分,作为评估的黄金标准。
  • 通过聚合来自SentiWordNet的词级情感得分,计算每篇文档的情感得分,以Word2Vec和Doc2Vec的向量表示作为输入特征。
  • 使用与SentiWordNet情感标准相关的相关性和分类指标,评估两种模型的性能。
  • 从检测特定疾病相关情感趋势的能力角度比较两种模型,评估其互补性。

实验结果

研究问题

  • RQ1无监督的Word2Vec和Doc2Vec模型能否在无标注数据下有效检测临床出院总结中的情感?
  • RQ2Word2Vec和Doc2Vec在单独识别临床叙述中针对特定疾病的潜在情感偏倚方面表现如何?
  • RQ3Word2Vec和Doc2Vec在临床文本情感分析中互补的程度如何?
  • RQ4这些模型推导出的情感得分与SentiWordNet提供的黄金标准相关性如何?
  • RQ5结合Word2Vec和Doc2Vec能否提升临床出院总结的情感检测准确率?

主要发现

  • Word2Vec和Doc2Vec模型在无监督的临床出院总结情感分析中表现优异,与基于SentiWordNet的情感得分具有高度相关性。
  • 结合Word2Vec和Doc2Vec的性能超越了单一模型的独立表现,表明二者具有互补优势。
  • Word2Vec在捕捉词级情感方面表现突出,尤其针对临床术语和描述性词汇;而Doc2Vec更擅长捕捉整体文档级的情感语境。
  • 本研究证实,使用预训练嵌入的无监督学习是临床文本中监督情感分析的可行且有效的替代方案。
  • SentiWordNet为在缺乏标注数据的情况下评估情感模型提供了可靠黄金标准,使有意义的性能比较成为可能。
  • 结果表明,两种模型均能有效检测临床叙述中针对特定疾病的潜在情感偏倚(正面或负面)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。