[論文レビュー] A Continuous-time Mutually-Exciting Point Process Framework for Prioritizing Events in Social Media
本稿では、自己励起、相互励起、バースト性のある相互作用ダイナミクスをモデル化することで、ソーシャルメディアのイベントを優先順位付けするための特徴変調型多次元ハーケス過程を提案する。テキスト特徴、感情分析特徴、時系列特徴を統合することで、ニュースフィードの優先順位付けにおいて最先端の性能を達成しており、言語的特徴およびユーザープロフィール特徴が新規イベントの順位付けにおいて最も予測力が高いことが判明した。
The overwhelming amount and rate of information update in online social media is making it increasingly difficult for users to allocate their attention to their topics of interest, thus there is a strong need for prioritizing news feeds. The attractiveness of a post to a user depends on many complex contextual and temporal features of the post. For instance, the contents of the post, the responsiveness of a third user, and the age of the post may all have impact. So far, these static and dynamic features has not been incorporated in a unified framework to tackle the post prioritization problem. In this paper, we propose a novel approach for prioritizing posts based on a feature modulated multi-dimensional point process. Our model is able to simultaneously capture textual and sentiment features, and temporal features such as self-excitation, mutual-excitation and bursty nature of social interaction. As an evaluation, we also curated a real-world conversational benchmark dataset crawled from Facebook. In our experiments, we demonstrate that our algorithm is able to achieve the-state-of-the-art performance in terms of analyzing, predicting, and prioritizing events. In terms of interpretability of our method, we observe that features indicating individual user profile and linguistic characteristics of the events work best for prediction and prioritization of new events.
研究の動機と目的
- 高頻度で急速に変化するコンテンツのため、ソーシャルメディアにおけるニュースフィード優先順位付けの課題に対処すること。
- 静的特徴(テキスト、感情)と動的特徴(時系列、相互作用ベース)を統合した1つのモデル化フレームワークを構築すること。
- ハーケス過程のパラメータ推定におけるデータ不足を、特徴ベースのパラメータ化により克服すること。
- 優先順位付けアルゴリズムの評価を目的とした、5万件のFacebook投稿および100万件のコメントを含む16のグループにわたる、新規で公開されたベンチマークデータセットを提供すること。
- 特徴重みとソーシャルインパクトおよび予測性能の関連性を明確にすることで、解釈性を向上させること。
提案手法
- 自己励起および相互励起を捉えるために、ハーケス過程を用いてソーシャルメディアの相互作用を多次元点過程としてモデル化する。
- 特徴(例:言語的、ユーザープロフィール、感情)の重み付き和として強度関数をパラメータ化することで、パラメータ数を削減し、一般化性能を向上させる。
- 観測された相互作用シーケンスから特徴重みおよび励起カーネルを推定するために、尤度に基づく学習目的関数を用いる。
- 時間非定常な強度関数を用いて、バースト性や減衰率といった時系列的ダイナミクスを統合する。
- 予測された将来の関与度に基づいて、ユーザのニュースフィードにおける投稿の優先順位を決定するためにモデルを適用する。
- ユーザーグループやデータセット間での性能比較を可能にするために、正規化平均順位(NAveRank)を評価指標として用いる。
実験結果
リサーチクエスチョン
- RQ1ソーシャルメディア相互作用の静的特徴と動的特徴を統合することで、イベント優先順位付けの性能をどのように向上させられるか?
- RQ2言語的特徴およびユーザープロフィール特徴は、ソーシャルメディアスレッドにおける将来の関与を予測するために、どの程度寄与するか?
- RQ3特徴変調型ハーケス過程は、ベースラインモデルに比べてニュースフィード優先順位付けタスクで優れた性能を示せるか?
- RQ4データスパarsityおよびグループ構造(例:ソーシャル型対トピックベースグループ)は、モデル性能にどのように影響するか?
- RQ5特徴同士の相関および過学習は、関係性ベース特徴に対して特に顕著な一般化性能の低下を引き起こすか?
主な発見
- 提案された特徴変調型ハーケスモデル(HWK-ALL)は、多様なFacebookグループにおいて、ソーシャルメディアイベントの優先順位付けで最先端の性能を達成した。
- 言語的特徴およびユーザープロフィール特徴は、常に関係性ベース特徴よりも優れた性能を示した。これは、Facebookのニュースフィードソートにおけるデータバイアスにより、関係性ベース特徴が過学習しやすい傾向にあるためである。
- 特徴なしハーケスモデル(HWK)は、カスケードの発生頻度が高く、ユーザ数が少ないグループでは良好に機能しており、データ量および構造に敏感であることが示された。
- 社会的関係に基づく、知人同士の相互作用が中心のグループ(例:地域住民、ボウリングプレイヤー)は、トピック中心で一時的貢献が中心のグループ(例:ゲームプレイヤー、馬のトレーナー)よりも予測が容易である。
- 正規化平均順位(NAveRank)は、社会的関係が強いグループで低く抑えられ、モデルの予測力がそのような環境でより高いことが確認された。
- 重複するまたは相関のある特徴(例:関係性ベース特徴と言語的特徴)は、ノイズや過学習を引き起こし、個々の特徴が情報を持っている場合でさえ性能を低下させる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。