Skip to main content
QUICK REVIEW

[論文レビュー] Using machine learning and information visualisation for discovering latent topics in Twitter news

Vladimir Vargas-Calderón, Marlon Steibeck Dominguez|arXiv (Cornell University)|Oct 21, 2019
Social Media and Politics参考文献 27被引用数 6
ひとこと要約

本稿では、教師あり分類と非教師ありトピックモデリング(LDAおよびFastText + K-means)を組み合わせた2段階手法を提案し、主要コロンビアメディア機関のニュースツイートにおける潜在的トピックを同定するとともに、ユーザーの返信からトピックを予測する。FastText + K-meansアプローチはLDAよりもトピックの解釈性と分類性能に優れ、返信からニューストピックを予測する際のトップ1での正確率と再現率が40%に達し、コロンビア和平協定が最も社会的インパクトの大きいトピックであることが明らかになった。

ABSTRACT

We propose a method to discover latent topics and visualise large collections of tweets for easy identification and interpretation of topics, and exemplify its use with tweets from a Colombian mass media giant in the period 2014--2019. The latent topic analysis is performed in two ways: with the training of a Latent Dirichlet Allocation model, and with the combination of the FastText unsupervised model to represent tweets as vectors and the implementation of K-means clustering to group tweets into topics. Using a classification task, we found that people respond differently according to the various news topics. The classification tasks consists of the following: given a reply to a news tweet, we train a supervised algorithm to predict the topic of the news tweet solely from the reply. Furthermore, we show how the Colombian peace treaty has had a profound impact on the Colombian society, as it is the topic in which most people engage to show their opinions.

研究の動機と目的

  • 主要コロンビアメディア機関の大量のニュースツイートから、非教師あり機械学習を用いて潜在的トピックを同定すること。
  • 異なるニューストピックに対する公的反応が、言語的および参加行動のパターンにおいて顕著に異なるかどうかを評価すること。
  • トピック発見と可視化を目的とした、LDAとFastText + K-meansの2つのトピックモデリングパイプラインの開発と比較を行うこと。
  • ユーザーの返信テキストのみを入力として用いて、ニュースツイートのトピックを予測する教師ありFastTextモデルを訓練すること。
  • 特にコロンビア和平協定を含む特定トピックの社会的インパクトを、参加指標を用いて評価すること。

提案手法

  • 2014年から2019年までの期間、Twitter APIを介して@NoticiasRCNから258,848件のニュースツイートおよび140万件の返信を収集した。
  • 句読点、URL、ハッシュタグ、メンションの削除および語形还原を実施し、すべて小文字に変換することでツイートを前処理した。
  • コーパス内の語の共起確率をモデル化することで、12個の潜在的トピックを学習するため、LDAを適用した。
  • FastTextを用いてツイートの密度の高いベクトル表現を生成し、その後K-meansクラスタリングを実行して12のクラスタ(トピック)に分類した。
  • LDAでは確率閾値(0.8)を、FastText + K-meansではクラスタ中心からの距離閾値を用いて、各トピックの代表的ツイートを選定した。
  • 返信テキストのみを入力として用いて、ニュースツイートのトピックを予測する教師ありFastText分類器を訓練した。

実験結果

リサーチクエスチョン

  • RQ1非教師ありトピックモデリングは、主要メディア機関のニュースツイートから潜在的トピックを効果的に同定できるか?
  • RQ2ニュースツイートに対する公的返信は、元のツイートのトピックに応じて、言語的パターンに顕著な差異を示すか?
  • RQ3LDAとFastText + K-meansのどちらのトピックモデリングアプローチが、より解釈可能で視覚的に整合性のあるトピックを生成するか?
  • RQ4教師ありモデルは、ユーザーの返信のみを用いて、ニュースツイートのトピックを正確に予測できるか?
  • RQ5同定されたトピックの中から、どのニューストピックが最高の公的参加と社会的インパクトを生み出しているか?

主な発見

  • FastText + K-meansアプローチは、LDAよりも解釈性が高く、視覚化において明確に分離されたトピッククラスタを生成した。
  • FastText + K-meansアプローチは、返信からニュースツイートのトピックを予測する際、トップ1での正確率と再現率が40%に達し、LDAを著しく上回った。
  • 「和平協定政治」トピックは最も参加が高く、1件あたりのいいね、リツイート、返信数が最多であった。
  • 分類タスクの結果から、人々のニュースツイートに対する反応はトピック依存であることが示され、各トピックごとに特徴的な言語的および感情的パターンが存在することがわかった。
  • LDAモデルは、トピック数(K)の調整が非常に重要であり、実際のトピックが融合または破壊されないよう注意深く調整する必要があったが、FastText + K-meansはこのような問題に対してより頑健であった。
  • 本研究は、コロンビア和平協定がデータセット内で最も社会的インパクトの大きな出来事であったことを確認した。参加指標すべてにおいて明確な公的関与が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。