[論文レビュー] A Probabilistic Framework for Location Inference from Social Media
本稿では、コンテンツ、ソーシャルネットワーク、およびディープニューラルネットワーク埋め込みを統合する半教師付き要因グラフモデル(SSFGM)を提案する。新規の2チェーンサンプリング(TCS)アルゴリズムを用いることで、従来のループ付きベイズ確率伝播(LBP)と比較して100倍以上の高速化を達成しながら、TwitterおよびWeiboデータセットにおいて高い精度を維持する。
We study the extent to which we can infer users' geographical locations from social media. Location inference from social media can benefit many applications, such as disaster management, targeted advertising, and news content tailoring. The challenges, however, lie in the limited amount of labeled data and the large scale of social networks. In this paper, we formalize the problem of inferring location from social media into a semi-supervised factor graph model (SSFGM). The model provides a probabilistic framework in which various sources of information (e.g., content and social network) can be combined together. We design a two-layer neural network to learn feature representations, and incorporate the learned latent features into SSFGM. To deal with the large-scale problem, we propose a Two-Chain Sampling (TCS) algorithm to learn SSFGM. The algorithm achieves a good trade-off between accuracy and efficiency. Experiments on Twitter and Weibo show that the proposed TCS algorithm for SSFGM can substantially improve the inference accuracy over several state-of-the-art methods. More importantly, TCS achieves over 100x speedup comparing with traditional propagation-based methods (e.g., loopy belief propagation).
研究の動機と目的
- ソーシャルメディアにおける限られたラベル付きデータからユーザーの地理的場所を推定する課題に取り組む。
- 場所推定が計算的に高コストである大規模ソーシャルネットワークにおけるスケーラビリティの問題を克服する。
- コンテンツ、ネットワーク構造、および学習されたディープ特徴といった多様な情報源を統合できる柔軟で一般化可能なモデルを開発する。
- ラベル付きデータが少量で、ラベルなしデータが多数存在する状況において、効果的な半教師付き学習を可能にする。
- 大規模なソーシャルネットワーク(数百万ノード規模)においても精度を損なわず、高速に推論が可能な効率的なアルゴリズムを設計する。
提案手法
- コンテンツ、ソーシャルネットワーク、および潜在的特徴表現を統合する半教師付き要因グラフモデル(SSFGM)として場所推定を形式化する。
- ユーザーのコンテンツとネットワーク構造から、低次元の特徴表現を学習する2層のニューラルネットワークを訓練する。
- 学習された潜在的特徴を、モデルの忠実性を向上させるためにSSFGMに追加のポテンシャル関数として組み込む。
- 2つの並列マルコフ連鎖を用いて事後分布を効率的に近似する、新規の推論手法である2チェーンサンプリング(TCS)アルゴリズムを提案する。
- TCSを並列化可能でスケーラブルに設計し、完全なグラフ伝搬に依存しないことで、大規模ネットワークにおける高速推論を可能にする。
- 従来の方法(例:ループ付きベイズ確率伝播(LBP))と比較して高い計算コストがかかるのを避けるために、サンプリングに基づく推論を採用する。
実験結果
リサーチクエスチョン
- RQ1コンテンツ、ソーシャルネットワーク構造、および学習されたディープ特徴を効果的に統合することで、ユーザーの場所推定をどのように向上させられるか?
- RQ2ラベル付き場所を持つユーザーが少数である状況でも、半教師付き確率的モデルが精度を向上させられるか?
- RQ3数百万ノード規模のソーシャルネットワークにおいて、精度を損なわず場所推定をスケーラブルに実現できるか?
- RQ4コンテンツ、プロファイル、ネットワーク特徴の各要因が場所予測性能に与える相対的寄与度は何か?
- RQ5サンプリングに基づく推論アルゴリズムは、従来の伝搬手法と比較して、高精度に加え、100倍以上の高速化を達成できるか?
主な発見
- 2チェーンサンプリング(TCS)アルゴリズムは、ループ付きベイズ確率伝播(LBP)と比較して100倍以上の高速化を達成し、小規模データセットでは学習時間を16.8分から9秒未満に短縮した。
- 大規模なTwitterおよびWeiboデータセットにおいて、TCSで訓練されたSSFGMは、GCNやLBPを含む既存手法を上回る最先端の精度を達成した。
- コンテンツベースの特徴が場所予測に最も顕著な寄与を示し、その特徴を除去すると精度が12.5%低下した。続くのはネットワーク特徴とプロファイル特徴であった。
- ラベル付きデータがたった10%の状況でも、モデルは強力な性能を維持しており、学習データが増加するにつれて一貫した精度向上を示した。これに対して、ベースラインのロジスティック回帰は同様の向上を示さなかった。
- TCSによる百万規模のデータセットの学習は、単一GPUで1〜2時間で完了したのに対し、GCNでは11時間以上を要した。これにより、優れたスケーラビリティが示された。
- 小規模なFacebookデータセットにおいて、SSFGMにTCSを適用した結果、LBPと同等の91.23%の精度を達成したが、118倍の高速化を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。