Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Medical Short Text Classification with Semantic Expansion Using Word-Cluster Embedding

Ying Shen, Qiang Zhang|arXiv (Cornell University)|2018. 12. 05.
Topic Modeling참고 문헌 11인용 수 4
한 줄 요약

이 논문은 심층 신경망에 단어 클러스터 임베딩을 통합하여 의료 분야의 단문 분류를 위한 의미 확장 방법을 제안한다. 단어 벡터를 군집화하고 클러스터 중심을 사용하여 의미 표현을 풍부화시킴으로써, 일반 도메인 및 의료 도메인 단문 모두에서 성능을 향상시킨다. 제안된 방법은 TREC 및 새로 공개된 의료 데이터셋에서 최신 기준(SOTA)을 초월한다.

ABSTRACT

Automatic text classification (TC) research can be used for real-world problems such as the classification of in-patient discharge summaries and medical text reports, which is beneficial to make medical documents more understandable to doctors. However, in electronic medical records (EMR), the texts containing sentences are shorter than that in general domain, which leads to the lack of semantic features and the ambiguity of semantic. To tackle this challenge, we propose to add word-cluster embedding to deep neural network for improving short text classification. Concretely, we first use hierarchical agglomerative clustering to cluster the word vectors in the semantic space. Then we calculate the cluster center vector which represents the implicit topic information of words in the cluster. Finally, we expand word vector with cluster center vector, and implement classifiers using CNN and LSTM respectively. To evaluate the performance of our proposed method, we conduct experiments on public data sets TREC and the medical short sentences data sets which is constructed and released by us. The experimental results demonstrate that our proposed method outperforms state-of-the-art baselines in short sentence classification on both medical domain and general domain.

연구 동기 및 목표

  • 전자 의무 기록(EMR)에서 기인하는 단문 의료 텍스트의 의미 기능 부족 및 모호성 문제를 해결하기 위해.
  • 단문 의료 텍스트 분류 작업에서 심층 신경망 분류기의 성능을 향상시키기 위해.
  • 클러스터 수준의 주제 정보를 활용하여 단어 표현을 향상시키는 의미 확장 기법을 개발하기 위해.
  • 일반 도메인(TREC) 및 도메인 특화(의료) 단문 데이터셋 모두에서 방법을 평가하기 위해.

제안 방법

  • 의미 공간 내 단어 벡터에 계층적 응집 군집화를 적용하여 의미적으로 유사한 단어들을 그룹화한다.
  • 각 단어 클러스터의 중심점(클러스터 중심)을 계산하여 클러스터의 암묵적 주제를 표현한다.
  • 개별 단어 벡터를 해당 클러스터 중심 벡터와 조합하여 의미 기능을 풍부화시킨다.
  • 확장된 단어 벡터를 CNN 및 LSTM 아키텍처에 통합하여 텍스트 분류를 수행한다.
  • 확장된 표현을 사용하여 분류기를 종단 간(end-to-end)으로 훈련 및 미세조정한다.
  • 평가를 위해 공개된 TREC 데이터셋 외에 새로 구축한 의료 단문 문장 데이터셋을 사용한다.

실험 결과

연구 질문

  • RQ1단어-클러스터 임베딩을 통한 의미 확장은 단문 의료 텍스트의 표현을 향상시킬 수 있는가?
  • RQ2클러스터 수준의 주제 정보 통합은 단문 분류 성능을 향상시키는가?
  • RQ3제안된 방법은 의료 및 일반 도메인 단문 분류에서 최신 기준(SOTA) 방법과 비교해 어떻게 성능을 낼 수 있는가?
  • RQ4이 방법은 단문 의료 텍스트의 의미 모호성과 특징 희소성 문제를 어느 정도 완화하는가?

주요 결과

  • 제안된 방법은 단문 분류 분야에서 최신 기준(SOTA)을 초월하는 성능을 TREC 데이터셋에서 확보하였다.
  • 최근 공개된 의료 단문 문장 데이터셋에서, 분류 정확도 측면에서 기존 방법들을 뚜렷이 뛰어넘었다.
  • 클러스터 중심 벡터 통합은 의미의 풍부함을 향상시켜 단문 의료 텍스트의 모호성을 감소시켰다.
  • CNN 및 LSTM 모델 모두가 의미 확장의 이점을 얻었으며, 이는 아키텍처 간의 일반화 가능성에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.