Skip to main content
QUICK REVIEW

[논문 리뷰] Word2Vec and Doc2Vec in Unsupervised Sentiment Analysis of Clinical Discharge Summaries

Qufei Chen, Marina Sokolova|arXiv (Cornell University)|2018. 05. 01.
Topic Modeling참고 문헌 9인용 수 22
한 줄 요약

이 연구는 레이블이 없는 감성 데이터가 있는 임상 퇴원 요약문에 대해 비지도 Word2Vec 및 Doc2Vec 모델을 적용하여 감성 분석을 수행한다. SentiWordNet을 금표 기준으로 삼아, 저자들은 Word2Vec과 Doc2Vec가 상호 보완적으로 작용하여 실제적인, 주석이 없는 환경에서 임상 텍스트의 감성 탐지 정확도를 향상시킴을 입증한다.

ABSTRACT

In this study, we explored application of Word2Vec and Doc2Vec for sentiment analysis of clinical discharge summaries. We applied unsupervised learning since the data sets did not have sentiment annotations. Note that unsupervised learning is a more realistic scenario than supervised learning which requires an access to a training set of sentiment-annotated data. We aim to detect if there exists any underlying bias towards or against a certain disease. We used SentiWordNet to establish a gold sentiment standard for the data sets and evaluate performance of Word2Vec and Doc2Vec methods. We have shown that the Word2vec and Doc2Vec methods complement each other results in sentiment analysis of the data sets.

연구 동기 및 목표

  • 감성 주석이 필요한 비용이 많이 드는 훈련 데이터에 의존하지 않고도 임상 퇴원 요약문에서 감성 분석을 위한 비지도 접근법을 개발하는 것.
  • 명시적인 감성 레이블 없이 Word2Vec와 Doc2Vec가 임상 텍스트의 감성 표현을 얼마나 잘 포착하는지 평가하는 것.
  • 이러한 모델이 임상 서술문에서 특정 질병에 대한 잠재적 감성 편향(선호 또는 비선호)을 탐지할 수 있는지 조사하는 것.
  • SentiWordNet을 기준 기준으로 삼아 Word2Vec와 Doc2Vec의 감성 분류 성능을 평가하고 비교하는 것.
  • Word2Vec과 Doc2Vec를 결합하면 임상 텍스트에서 감성 탐지 정확도가 향상되는지 확인하는 것.

제안 방법

  • Word2Vec을 사용하여 임상 퇴원 요약문의 개별 단어에서 조밀한 벡터 표현을 학습한다.
  • Doc2Vec을 활용하여 전체 퇴원 요약문의 감성 총합을 반영하는 문서 수준의 임베딩을 생성한다.
  • SentiWordNet을 사전에 존재하는 감성 어휘로 활용하여 단어 및 어구에 감성 점수를 할당하고, 평가의 금표 기준으로 삼는다.
  • SentiWordNet에서 유도된 단어 수준의 감성 점수를 집계하여 각 문서의 감성 점수를 계산하며, 이때 Word2Vec 및 Doc2Vec의 벡터 표현을 입력 특징으로 사용한다.
  • SentiWordNet 기반 감성 기준과의 상관관계 및 분류 지표를 사용하여 두 모델의 성능을 평가한다.
  • 특정 질병과 관련된 감성 추세 탐지 능력 측면에서 두 모델의 성능을 비교하여 상호 보완성 여부를 평가한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 데이터가 있는 환경에서 비지도 Word2Vec 및 Doc2Vec 모델이 임상 퇴원 요약문의 감성 탐지에 효과적으로 작용할 수 있는가?
  • RQ2Word2Vec과 Doc2Vec가 개별적으로 임상 서술문에서 특정 질병에 대한 감성 편향을 탐지하는 데 얼마나 잘 작동하는가?
  • RQ3Word2Vec과 Doc2Vec가 임상 텍스트 감성 분석에서 얼마나 서로 보완적인가?
  • RQ4이러한 모델에서 유도된 감성 점수는 SentiWordNet이 제공하는 금표 기준과 얼마나 상관이 있는가?
  • RQ5Word2Vec과 Doc2Vec의 통합이 임상 퇴원 요약문의 감성 탐지 정확도를 향상시킬 수 있는가?

주요 결과

  • Word2Vec과 Doc2Vec 모델은 SentiWordNet 기반 감성 점수와 높은 상관관계를 보이며, 비지도 감성 분석에서 뛰어난 성능을 보였다.
  • Word2Vec과 Doc2Vec를 조합하면 개별적으로 각각 수행한 성능을 초월하여 감성 탐지 정확도가 향상되었으며, 이는 상호 보완적 강점이 있음을 시사한다.
  • Word2Vec은 임상 용어 및 묘사어 수준에서 감성 표현을 잘 포착하는 데 뛰어났고, Doc2Vec는 전체 문서 수준의 감성 맥락을 더 잘 반영하였다.
  • 이 연구는 사전에 학습된 임베딩을 활용한 비지도 학습이 감성 주석이 없는 임상 텍스트에서 감성 분석의 효과적이고 타당한 대안이 될 수 있음을 확인하였다.
  • SentiWordNet은 주석이 없는 환경에서 감성 모델 평가에 신뢰할 수 있는 금표 기준을 제공하여 의미 있는 성능 비교를 가능하게 하였다.
  • 결과적으로 두 모델이 임상 서술문에서 특정 질병에 대한 감성 편향(선호 또는 비선호)을 탐지하는 데 효과적이라는 점이 제안되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.