Skip to main content
QUICK REVIEW

[論文レビュー] Improving Medical Short Text Classification with Semantic Expansion Using Word-Cluster Embedding

Ying Shen, Qiang Zhang|arXiv (Cornell University)|Dec 5, 2018
Topic Modeling参考文献 11被引用数 4
ひとこと要約

本稿では、深層ニューラルネットワークに単語クラスタリング埋め込みを統合することで、医療分野の短いテキスト分類のための意味的拡張手法を提案する。単語ベクトルをクラスタリングし、クラスタ中心を用いて意味的表現を豊かにすることで、一般ドメインおよび医療ドメインの両方の短いテキストにおいて性能が向上し、TRECおよび新たに公開された医療データセットにおいて最先端のベースラインを上回る。

ABSTRACT

Automatic text classification (TC) research can be used for real-world problems such as the classification of in-patient discharge summaries and medical text reports, which is beneficial to make medical documents more understandable to doctors. However, in electronic medical records (EMR), the texts containing sentences are shorter than that in general domain, which leads to the lack of semantic features and the ambiguity of semantic. To tackle this challenge, we propose to add word-cluster embedding to deep neural network for improving short text classification. Concretely, we first use hierarchical agglomerative clustering to cluster the word vectors in the semantic space. Then we calculate the cluster center vector which represents the implicit topic information of words in the cluster. Finally, we expand word vector with cluster center vector, and implement classifiers using CNN and LSTM respectively. To evaluate the performance of our proposed method, we conduct experiments on public data sets TREC and the medical short sentences data sets which is constructed and released by us. The experimental results demonstrate that our proposed method outperforms state-of-the-art baselines in short sentence classification on both medical domain and general domain.

研究の動機と目的

  • 電子カルテ(EMR)から得られる短い医療テキストにおける意味的特徴の不足と曖昧さの課題に対処すること。
  • 短い医療テキスト分類タスクにおける深層ニューラルネットワーク分類器の性能を向上させること。
  • クラスタレベルのトピック情報を利用して語表現を強化する意味的拡張技術を開発すること。
  • 一般ドメイン(TREC)およびドメイン特化型(医療)の短いテキストデータセットの両方で、手法を評価すること。

提案手法

  • 意味的空間内の単語ベクトルに対して階層的凝集型クラスタリングを適用し、意味的に類似した単語をグループ化する。
  • 各単語クラスタの重心(クラスタ中心)を計算し、クラスタの暗黙のトピックを表す。
  • 個々の単語ベクトルを、対応するクラスタ中心ベクトルと組み合わせることで意味的特徴を豊かにする。
  • 拡張された単語ベクトルをCNNおよびLSTMアーキテクチャに統合し、テキスト分類を実行する。
  • 拡張表現を用いて、エンドツーエンドで分類器を訓練および微調整する。
  • 評価のために、公に提供されているTRECデータセットに加え、新たに構築した医療分野の短い文データセットを用いる。

実験結果

リサーチクエスチョン

  • RQ1語クラスタリング埋め込みによる意味的拡張は、短い医療テキストの表現を改善できるか?
  • RQ2クラスタレベルのトピック情報の統合は、短いテキストにおける分類性能を向上させるか?
  • RQ3提案手法は、医療分野および一般ドメインの両方における短いテキスト分類において、最先端の手法と比較してどのように差をつけるか?
  • RQ4この手法は、短い医療テキストにおける意味的曖昧さと特徴のスパarsityをどの程度軽減できるか?

主な発見

  • 提案手法は、短いテキスト分類における最先端のベースラインと比較して、TRECデータセットにおいて優れた性能を達成した。
  • 新たに公開された医療分野の短い文データセットでは、分類精度の面で既存の手法を著しく上回った。
  • クラスタ中心ベクトルの統合により意味的豊かさが向上し、短い医療テキストの曖昧さが軽減された。
  • CNNおよびLSTMモデルの両方が意味的拡張の恩恵を受けており、アーキテクチャを問わず汎用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。