Skip to main content
QUICK REVIEW

[論文レビュー] A Bayesian Framework for Community Detection Integrating Content and Link

Tianbao Yang, Rong Jin|arXiv (Cornell University)|May 9, 2012
Text and Document Classification Technologies被引用数 4
ひとこと要約

本稿では、ノードのコンテンツとネットワークリンクを統合するベイジアンフレームワークを提案する。リンク形成におけるノードの人気度をモデル化し、コミュニティ割り当てに特徴的なコンテンツモデルを用いることで、実世界のデータセット上で近似ベイジアン推論を用いて、コンテンツとリンク情報を統合する最先端手法を凌駆する精度を達成した。

ABSTRACT

This paper addresses the problem of community detection in networked data that combines link and content analysis. Most existing work combines link and content information by a generative model. There are two major shortcomings with the existing approaches. First, they assume that the probability of creating a link between two nodes is determined only by the community memberships of the nodes; however other factors (e.g. popularity) could also affect the link pattern. Second, they use generative models to model the content of individual nodes, whereas these generative models are vulnerable to the content attributes that are irrelevant to communities. We propose a Bayesian framework for combining link and content information for community detection that explicitly addresses these shortcomings. A new link model is presented that introduces a random variable to capture the node popularity when deciding the link between two nodes; a discriminative model is used to determine the community membership of a node by its content. An approximate inference algorithm is presented for efficient Bayesian inference. Our empirical study shows that the proposed framework outperforms several state-of-theart approaches in combining link and content information for community detection.

研究の動機と目的

  • 既存の生成モデルがリンクがコミュニティメンバーシップにのみ依存すると仮定しており、関係のないコンテンツ属性に敏感であるという限界を是正すること。
  • コンテンツとリンク情報をより強固に統合する統一フレームワークを構築すること。
  • コミュニティメンバーシップだけでなく、リンク形成に影響を与える要因としてノードの人気度を明示的にモデル化すること。
  • コンテンツに基づくコミュニティ割り当てに判別モデルを用いることで、非コミュニティ関連属性への感受性を低減すること。
  • スケーラブルなコミュニティ検出を可能にする近似推論アルゴリズムにより、効率的なベイジアン推論を可能にすること。

提案手法

  • ノードの人気度を潜在的確率変数として組み込んだ新しいリンクモデルを導入し、コミュニティメンバーシップ以外の要因によるリンク形成をよりよく説明する。
  • ノードコンテンツに基づいてコミュニティメンバーシップを予測する判別モデル(例:ロジスティック回帰または類似手法)を用い、不要な属性への感受性を低減する。
  • コミュニティメンバーシップ、ノードの人気度、コンテンツトピック関係を同時に推論するベイジアン階層モデルを採用する。
  • スケーラビリティを確保するため、変分推論を用いて近似ベイジアン推論を実装する。
  • コンテンツをトピックモデル(例:LDAに類似)でモデル化するが、コミュニティ割り当ては判別的分類器を介してコンテンツに条件づける。
  • 生成的と判別的なコンponentを統合するハイブリッドアプローチ:リンクとトピックモデリングには生成的モデル、コミュニティ割り当てには判別的モデルを用いる。

実験結果

リサーチクエスチョン

  • RQ1ノードの人気度をどのように明示的にモデル化することで、コミュニティメンバーシップ以外の要因を考慮したリンク予測とコミュニティ検出を改善できるか?
  • RQ2コンテンツからコミュニティ割り当てに判別モデルを用いることで、純粋な生成的コンテンツモデルと比較して、どの程度感受性が低減され、ロバストネスが向上するか?
  • RQ3生成的と判別的コンponentを統合したハイブリッドベイジアンフレームワークは、既存の最先端手法を凌駆できるか?
  • RQ4コンテンツとリンク情報の統合は、検出されたコミュニティの精度と安定性にどのように影響するか?
  • RQ5提案された近似ベイジアン推論アルゴリズムは、実世界のネットワークにおいてスケーラビリティと推論効率にどの程度寄与するか?

主な発見

  • 提案フレームワークは、コンテンツとリンクを統合する最先端手法と比較して、コミュニティ検出の精度がより高いことを達成した。
  • リンクモデルにノードの人気度を組み込むことで、リンク予測とコミュニティ構造の回復が顕著に向上した。
  • 判別的コンテンツモデルにより、非コミュニティ関連属性への感受性が低減され、ロバストネスが向上した。
  • 近似推論アルゴリズムにより、大規模ネットワーク上での効率的計算が可能となり、フレームワークの実用性が確保された。
  • 実世界データセットを用いた実証的評価では、正規化相互情報量や調整ランダム係数といった複数の指標で一貫した性能向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。