Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Events and Patterns in Large-Scale User Generated Textual Streams with Statistical Learning Methods

Vasileios Lampos|arXiv (Cornell University)|Aug 13, 2012
Complex Network Analysis Techniques参考文献 154被引用数 11
ひとこと要約

本博士論文は、主にTwitterを含む大規模なユーザ生成テキストストリームから、疫学的流行、降雨、社会的気分の変化といった現実世界の出来事やパターンを検出するための統計的機械学習手法を提案する。線形・非線形・ハイブリッド推論技術を用いてテキスト特徴量を抽出・モデリングすることで、出来事の動態や感情傾向の予測において優れた性能を達成し、ソーシャルメディアが公衆衛生や社会科学研究の監視に有用であることを示している。

ABSTRACT

A vast amount of textual web streams is influenced by events or phenomena emerging in the real world. The social web forms an excellent modern paradigm, where unstructured user generated content is published on a regular basis and in most occasions is freely distributed. The present Ph.D. Thesis deals with the problem of inferring information - or patterns in general - about events emerging in real life based on the contents of this textual stream. We show that it is possible to extract valuable information about social phenomena, such as an epidemic or even rainfall rates, by automatic analysis of the content published in Social Media, and in particular Twitter, using Statistical Machine Learning methods. An important intermediate task regards the formation and identification of features which characterise a target event; we select and use those textual features in several linear, non-linear and hybrid inference approaches achieving a significantly good performance in terms of the applied loss function. By examining further this rich data set, we also propose methods for extracting various types of mood signals revealing how affective norms - at least within the social web's population - evolve during the day and how significant events emerging in the real world are influencing them. Lastly, we present some preliminary findings showing several spatiotemporal characteristics of this textual information as well as the potential of using it to tackle tasks such as the prediction of voting intentions.

研究の動機と目的

  • 大規模かつ非構造的なユーザ生成テキストストリームから現実世界の出来事を検出するための統計的学習手法を開発すること。
  • 疾病の流行や気象現象といった対象の出来事の特徴を表す意味のあるテキスト特徴量を特定・抽出すること。
  • ソーシャルメディアにおける時間的および感情的パターンをモデル化し、現実世界の出来事への一般の感情の変化を理解すること。
  • 投票意思や公衆衛生トレンドといった社会現象の予測可能性について、ソーシャルメディアデータの潜在的可能性を評価すること。
  • 厳密な統計的推論を通じて、Twitterデータが現実世界の動態の代理として使用可能であることを実証すること。

提案手法

  • テキスト特徴量から出来事関連の信号を推定するために、線形および正則化回帰モデル(例:LASSO)を用いた。
  • テキストコンテンツと現実世界の出来事との間の複雑な関係を捉えるために、非線形およびハイブリッド推論モデルを適用した。
  • 部分品詞タギング、感情用語彙集(例:LIWC)、語句頻度分析などの自然言語処理技術を用いてテキスト特徴量を抽出した。
  • 時間系列モデリングを用いて、地理的・時間的スケールの異なる範囲で感情や出来事検出における日周・時空間的パターンを分析した。
  • 特徴表現の向上とテキストストリーム内のノイズ低減のため、ストップワード除去およびステミング(例:ポーターステミング)を統合した。
  • 事前に整備された感情および感情的用語彙集(例:ペネバックのLIWC)を活用し、気分信号を抽出し、時間経過に伴う感情の基準パターンを追跡した。

実験結果

リサーチクエスチョン

  • RQ1統計的学習モデルは、Twitterテキストストリームからインフルエンザの流行や降雨といった現実世界の出来事を、高い正確性で検出可能か?
  • RQ2ソーシャルメディアのコンテンツから抽出されたテキスト特徴量は、実際の公衆衛生や環境現象とどの程度相関するか?
  • RQ3ソーシャルメディアにおける気分や感情信号は、現実世界の出来事や一般の感情の変化をどの程度反映しているか?
  • RQ4出来事検出および予測に活用可能な、ユーザ生成コンテンツの時空間的特性は何か?
  • RQ5ソーシャルメディアデータは、危機時における投票意思や公衆の懸念レベルといった社会的行動を予測するために使用可能か?

主な発見

  • 特に正則化回帰およびハイブリッド手法を用いた統計的学習モデルは、Twitterデータからインフルエンザの流行といった現実世界の出来事の検出において優れた性能を示した。
  • 本研究では、ソーシャルメディアから抽出されたテキスト特徴量が、降水量や疾病の有病率を、実測値と有意に相関させる予測が可能であることを実証した。
  • Twitterから抽出した気分信号には、神経症的傾向や抑うつ状態と相関する日周パターンが認められ、オンライン集団に検出可能な感情リズムが存在することを示した。
  • インフルエンザH1N1パンデミックや地震といった顕著な現実世界の出来事は、ソーシャルメディア上の感情や言語使用に測定可能で検出可能な変化を引き起こした。
  • ソーシャルメディアコンテンツの時間的ダイナミクスは一貫した時空間的パターンを示し、公式報告より前段階での新規出来事の早期検出が可能であることを示した。
  • 語彙的・感情的・時間的特徴量の複数のタイプの統合により、特に非線形な出来事検出タスクにおいてモデルの性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。