Skip to main content
QUICK REVIEW

[論文レビュー] Yoga-Veganism: Correlation Mining of Twitter Health Data

Tunazzina Islam|arXiv (Cornell University)|Jun 15, 2019
Eating Disorders and BehaviorsPsychology被引用数 18
ひとこと要約

本研究では、40,000件の健康関連ツイートに対してトピックモデリング(LSA、NMF、LDA)を適用し、ライフスタイル行動における隠れたパターンや相関関係を特定した。ヨガとビーガニズムの間には顕著な相関関係が認められ、トレーニング精度は66%、テスト精度は51%に達した。また、将来の誤った予測の分析を可能にするために、LIMEを用いてモデルの解釈性を向上させた。

ABSTRACT

Nowadays social media is a huge platform of data. People usually share their interest, thoughts via discussions, tweets, status. It is not possible to go through all the data manually. We need to mine the data to explore hidden patterns or unknown correlations, find out the dominant topic in data and understand people's interest through the discussions. In this work, we explore Twitter data related to health. We extract the popular topics under different categories (e.g. diet, exercise) discussed in Twitter via topic modeling, observe model behavior on new tweets, discover interesting correlation (i.e. Yoga-Veganism). We evaluate accuracy by comparing with ground truth using manual annotation both for train and test data.

研究の動機と目的

  • 健康関連のソーシャルメディアコンテンツに隠れた相関関係、特にヨガや植物性食などのライフスタイル行動の間の相関関係を特定すること。
  • 未構造化のツイッター・データから主要なトピックを抽出するために、トピックモデリング手法(LSA、NMF、LDA)を適用すること。
  • 手動によるアノテーションとランダムベースラインとの比較を通じて、モデルの性能を評価し、トピック推論の正確性を検証すること。
  • 誤ったまたは関係のないトピック予測を特定・分析し、モデルの解釈性を向上させること。
  • ストリーミング・データパイプライン(Kafka、Spark Streaming)を用いたリアルタイムの健康トレンド監視の実現可能性を検討すること。

提案手法

  • フィットネス、食事、ウェルネスに関連するキーワードを用いて、TwitterのストリーミングAPIを介して40,000件の健康関連ツイートを収集した。
  • 大容量のツイッター・データをリアルタイムでストリーミングおよび処理するために、Apache Kafkaを分散メッセージキューとして使用した。
  • 大規模なツイートストリームを処理するため、並列かつ分散処理が可能なSpark Streamingを採用した。
  • 意味的トピックを抽出するために、3つのトピックモデリングアルゴリズム(潜在的意味分析:LSA、非負値行列分解:NMF、潜在ディリクレ配分:LDA)を適用した。
  • 精度評価のための基準となるデータを得るために、トレインおよびテストセットから100~500件のツイートを手動でアノテートした。
  • 誤分類や誤ったトピック予測を分析・説明するために、モデルに依存しない解釈性のためのLIMEを用いた。

実験結果

リサーチクエスチョン

  • RQ1Twitterデータにおいて、健康関連の主要なトピックは何か。また、それらは異なるライフスタイルカテゴリにどのようにクラスタリングされるか。
  • RQ2LSA、NMF、LDAといったトピックモデリングアルゴリズムは、人間によるアノテーションに基づく基準と比較して、健康関連ツイートの真の主題的内容をどの程度正確に推定できるか。
  • RQ3公共のソーシャルメディア発言において、ヨガやビーガニズムといったライフスタイル行動の間に、隠れた相関関係は存在するか。
  • RQ4なぜ一部のトピックモデルが、誤ったまたは関係のないトピックを特定のツイートに割り当てるのか。そのような誤りを引き起こす要因は何か。
  • RQ5LIMEのようなモデルの解釈性技術は、ソーシャルメディアテキスト分析における誤ったトピック予測を特定・説明するのに役立つだろうか。

主な発見

  • 手動でアノテートした500件のツイートに対して評価した結果、モデルはトレーニングセットで66%、テストセットで51%の精度を達成し、4つのトピックに対する25%のベースラインを著しく上回った。
  • トピック1は、ほとんどのツイートにおいて最も頻度の高い主要または第2位のトピックであり、キーワード「diet」(食事)、「workout」(運動)、「healthy」(健康)、「weightloss」(ダイエット)によって特徴づけられた。
  • データ内ではヨガとビーガニズムの間で強い相関関係が観察され、多くのツイートで両者の実践が同じ文脈で言及された。
  • 曖昧な言語のため、モデルが「water in hand」(手の中の水)をスイミングに関連すると解釈し、誤ったトピック割り当てをしたことがある。
  • テストケースの10件中4件で誤った予測が特定され、LIMEを用いた解釈性と誤差分析の向上の必要性が浮き彫りになった。
  • KafkaとSpark Streamingの使用により、大規模なツイッター・データストリームのスケーラブルかつリアルタイム処理が可能となり、大規模なトピックモデリングを効率的に行えるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。