Skip to main content
QUICK REVIEW

[論文レビュー] Marked Self-Exciting Point Process Modelling of Information Diffusion on Twitter

Feng Chen, Wai Hong Tan|arXiv (Cornell University)|Feb 26, 2018
Complex Network Analysis Techniques参考文献 27被引用数 3
ひとこと要約

本稿では、パラメトリックで時間に依存する強度関数を用いてリツイートカスケードをモデル化することで、ツイートの人気度を予測するマーク付き自己駆動型ポイント過程モデルであるMaSEPTiDEを提案する。非パラメトリック手法と比較して、特に短い観測ウィンドウ(例:6時間未塔)において優れた性能を示す。これは、信頼性の高い推定に必要なデータが少ない完全パラメトリック構造のおかげである。

ABSTRACT

Information diffusion occurs on microblogging platforms like Twitter as retweet cascades. When a tweet is posted, it may be retweeted and henceforth further retweeted, and the retweeting process continues iteratively and indefinitely. A natural measure of the popularity of a tweet is the number of retweets it generates. Accurate predictions of tweet popularity can assist Twitter to rank contents more effectively and facilitate the assessment of potential for marketing and campaigning strategies. In this paper, we propose a model called the Marked Self-Exciting Process with Time-Dependent Excitation Function, or MaSEPTiDE for short, to model the retweeting dynamics and to predict the tweet popularity. Our model does not require expensive feature engineering but is capable of leveraging the observed dynamics to accurately predict the future evolution of retweet cascades. We apply our proposed methodology on a large amount of Twitter data and report substantial improvement in prediction performance over existing approaches in the literature.

研究の動機と目的

  • 初期のリツイート動態に基づいて、ツイートの最終的人気度を予測する、強固でデータ効率の良いモデルの開発。
  • TiDeHのような非パラメトリックモデルの限界、特に信頼性のある感染性推定に長時間の観測と大規模データセットを必要とする点の是正。
  • 最適化された成分関数を用いた完全パラメトリックな強度関数の定式化により、初期予測の精度を向上。
  • Twitterのようなソーシャルメディアプラットフォームにおけるリアルタイムの人気度予測のためのスケーラブルで実用的なソリューションの提供。
  • 極めてリツイートされたカスケード(例:2,000件以上)に依存する既存のモデルのバイアスを是正し、平均的なツイートを代表するものではない点の是正。

提案手法

  • 各リツイートが将来のリツイート強度を増加させるマーク付き自己駆動型ポイント過程としてリツイートをモデル化。
  • 非線形最適化を用いて推定される、時間に依存する感染性関数と記憶核関数から成るパラメトリック強度関数を採用。
  • 時間依存する感染性および記憶核関数を柔軟に表現するためにBスプライン基底関数を用いる。
  • 訓練データ上で適合度評価を実施し、最適なパラメトリック形式(例:感染性に多項式減衰、記憶核に指数減衰)を選択。
  • 初期段階として非パラメトリックカーネルスムージングを用いるが、最終的な推論には依存しない。
  • 時間経過に伴う推定された強度関数の積分により最終リツイート数を予測し、限られた観測ウィンドウからの早期予測を可能にする。

実験結果

リサーチクエスチョン

  • RQ1完全パラメトリックなマーク付き自己駆動型ポイント過程モデルは、非パラメトリックな代替手法と比較して、ツイートの人気度予測において優れた初期予測を達成できるか?
  • RQ22~6時間程度の短い観測ウィンドウで学習した場合、MaSEPTiDEの予測精度はTiDeHおよびSEISMICと比較してどの程度か?
  • RQ3MaSEPTiDEのパラメトリック構造は、非パラメトリック手法と比較して、データ要件をどの程度低減し、推定の安定性を向上させるか?
  • RQ4特に人気のないツイートにおいて、カスケード長の違いに応じてモデルの性能はどのように変化するか?
  • RQ5大多数の既存データセットが極めて拡散性の高いコンテンツに偏っていることを踏まえ、MaSEPTiDEは平均的なツイートの人気度を一般化して予測できるか?

主な発見

  • 2、4、6時間のcensoring時刻において、MaSEPTiDEはTiDeHおよびSEISMICと比較して、条件付き中央値予測の平均絶対誤差(MAE)が顕著に低かった。
  • 8、10、12時間ではMaSEPTiDEの性能はTiDeHと同等であったが、8時間以降にややTiDeHが優位になるに過ぎず、その時点で大多数のリツイートはすでに発生している。
  • 観測時間の経過とともに予測精度が急速に向上し、ツイート投稿後2時間以内に信頼性の高い結果が得られた。
  • パラメトリックな定式化によりデータ依存性が低減され、リツイートシーケンスが限られた場合でも安定した推定が可能になった。
  • 特に中程度から高水準の人気を持つカスケードにおいて、MaSEPTiDEは他のアプローチを上回り、短い観測期間に対しても頑健であることが示された。
  • 本研究では、2,000件以上のリツイートを記録したカスケードで学習したモデルは、平均的なツイートを代表しておらず、既存のデータセットの主な限界を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。