Skip to main content
QUICK REVIEW

[論文レビュー] Deep Representation Learning for Clustering of Health Tweets

Oguzhan Gencoglu|arXiv (Cornell University)|Dec 25, 2018
Topic Modeling参考文献 57被引用数 4
ひとこと要約

本稿では、ラベルなしデータを用いた健康関連ツイートの教師なし表現学習のための深層畳み込み自己符号化器(CAE)を提案し、従来の手法(bag-of-words、tf-idf、LDA、NMF)と比較して優れたクラスタリング性能を実現する。本手法は、Calinski-Harabaszスコアにおいて最先端のクラスタリング結果を達成し、次善のベースライン比で18%の改善を示し、学習済み表現にL2ノルム制約を適用することでさらなる性能向上を図っている。

ABSTRACT

Twitter has been a prominent social media platform for mining population-level health data and accurate clustering of health-related tweets into topics is important for extracting relevant health insights. In this work, we propose deep convolutional autoencoders for learning compact representations of health-related tweets, further to be employed in clustering. We compare our method to several conventional tweet representation methods including bag-of-words, term frequency-inverse document frequency, Latent Dirichlet Allocation and Non-negative Matrix Factorization with 3 different clustering algorithms. Our results show that the clustering performance using proposed representation learning scheme significantly outperforms that of conventional methods for all experiments of different number of clusters. In addition, we propose a constraint on the learned representations during the neural network training in order to further enhance the clustering performance. All in all, this study introduces utilization of deep neural network-based architectures, i.e., deep convolutional autoencoders, for learning informative representations of health-related tweets.

研究の動機と目的

  • ラベルなしデータを用いた短く動的な健康関連ツイートの教師なしクラスタリングの課題に対処すること。
  • 深層ニューラルネットワークを用いて生のツイートテキストからコンパクトで情報豊富な表現を学習することで、クラスタリング性能を向上させること。
  • 健康関連ツイートのクラスタリングにおいて、従来の特徴抽出手法と比較して深層表現学習の有効性を評価すること。
  • 学習済み表現へのL2ノルム制約がクラスタリング品質に与える影響を調査すること。

提案手法

  • 生の健康関連ツイートの低次元でコンパクトな表現を教師なしで学習するために、深層畳み込み自己符号化器(CAE)を採用する。
  • 訓練中に潜在表現の正則化およびクラスタ分離性の向上を目的として、L2ノルム制約を適用する。
  • 学習済み表現を、k-means、Wardの連結法、スペクトルクラスタリングの3つのクラスタリングアルゴリズムの入力として使用する。
  • 従来手法(bag-of-words、tf-idf、LDA、NMF、事前学習済み単語埋め込み(word2vec、GloVe、fastText))と性能を比較する。
  • クラスタリング品質を、正規化された内部クラスタリング指標であるCalinski-Harabasz(CH)スコアで評価する。
  • t-SNEおよびUMAPを用いて学習済み表現を可視化し、クラスタ分離性とL2制約の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1従来の特徴抽出手法と比較して、深層畳み込み自己符号化器は、クラスタリングのためのより効果的でコンパクトな表現を学習できるか?
  • RQ2学習済み表現へのL2ノルム制約は、異なるクラスタリングアルゴリズムにおいてクラスタリング性能にどのように影響するか?
  • RQ3事前学習済み単語埋め込み(例:fastText、BERT)は、従来の特徴抽出手法および深層自己符号化器と比較して、相対的にどの程度の性能を示すか?
  • RQ4高次元表現(例:生のtf-idfや連結された単語埋め込み)はサイズが大きいにもかかわらず、なぜ性能が劣るのか?
  • RQ5トピックモデリング手法(LDA、NMF)は、短テキストのツイートに対してクラスタリングタスクでどの程度一般化できるか?

主な発見

  • L2ノルム制約を適用した本手法の深層畳み込み自己符号化器は、50クラスタでCalinski-Harabaszスコア752.4を達成し、次善の手法(tf-idfを用いたLDAで638)を著しく上回った。
  • L2ノルム制約付きCAEは、3つのクラスタリングアルゴリズムすべてで性能向上を示し、特にL2距離に依存するk-meansクラスタリングで顕著な向上が見られた。
  • fastText単語埋め込みがword2vecやGloVeを上回ったのは、文字nグラムを用いて未知語トークンを処理できるためであり、薬剤名表現におけるゼロベクトル問題を軽減できたからである。
  • 生のtf-idfおよびbag-of-words特徴量は性能が低く、単語埋め込みを連結して高次元ベクトルにした場合も次元の呪いにより性能が低下した。
  • トピックモデル(LDAおよびNMF)は、ツイートの短さに起因する統計的安定性の欠如により、トピック推論に不適切であり、性能が劣った。
  • t-SNEおよびUMAPの可視化により、L2制約付きCAEが、制約なしの訓練に比べてより分離性が高く明確なクラスタを生成していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。