Skip to main content
QUICK REVIEW

[論文レビュー] A statistical interpretation of spectral embedding: the generalised random dot product graph

Patrick Rubin‐Delanchy, Joshua Cape|arXiv (Cornell University)|Sep 16, 2017
Complex Network Analysis Techniques被引用数 12
ひとこと要約

本稿では、一般化されたランダムドット積産業グラフ(GRDPG)を導入する。これは、ランダムドット積産業グラフを拡張した統計的モデルであり、異種結合性(heterophilic connectivity)と負の固有値を許容することで、スペクトル埋め込みを用いた一貫性のある漸近的にガウス分布に従う潜在位置推定を可能にする。GRDPGは、クラスタリングとは独立してスペクトル埋め込みを潜在位置推定手順としての統計的解釈を提供し、標準的なストークスティックブロックモデルを超えるより豊かなネットワーク構造を扱える。

ABSTRACT

Spectral embedding is a procedure which can be used to obtain vector representations of the nodes of a graph. This paper proposes a generalisation of the latent position network model known as the random dot product graph, to allow interpretation of those vector representations as latent position estimates. The generalisation is needed to model heterophilic connectivity (e.g., `opposites attract') and to cope with negative eigenvalues more generally. We show that, whether the adjacency or normalised Laplacian matrix is used, spectral embedding produces uniformly consistent latent position estimates with asymptotically Gaussian error (up to identifiability). The standard and mixed membership stochastic block models are special cases in which the latent positions take only $K$ distinct vector values, representing communities, or live in the $(K-1)$-simplex with those vertices, respectively. Under the stochastic block model, our theory suggests spectral clustering using a Gaussian mixture model (rather than $K$-means) and, under mixed membership, fitting the minimum volume enclosing simplex, existing recommendations previously only supported under non-negative-definite assumptions. Empirical improvements in link prediction (over the random dot product graph), and the potential to uncover richer latent structure (than posited under the standard or mixed membership stochastic block models) are demonstrated in a cyber-security example.

研究の動機と目的

  • ランダムドット積産業グラフが異種結合性の結合性をモデル化できないという限界を解消すること。
  • スペクトル埋め込みをクラスタリングとは独立した潜在位置推定手順としての統計的解釈を提供すること。
  • ストークスティックブロックモデルおよびミックスドメンバーシップモデルを、正定値でない結合構造を許容するように一般化すること。
  • 特に、複雑な潜在構造を有するサイバーセキュリティ応用分野において、より正確で原理的根拠のある推論を支援すること。
  • スペクトル埋め込みがGRDPGフレームワーク下で、一様に一貫性のある潜在位置推定を提供し、漸近的にガウス分布に従う誤差を有することを示すこと。

提案手法

  • 不定内積と負の固有値を許容する潜在位置ネットワークモデルとして、一般化されたランダムドット積産業グラフ(GRDPG)を提案する。
  • 隣接行列または正規化ラプラシアン行列のスペクトル埋め込みにより、ノードのd次元ベクトル表現を取得する。
  • 固有値スケーリングを適用して主固有ベクトルを抽出し、潜在位置の一貫性のある推定を可能にする。
  • GRDPGモデル下で潜在位置推定の理論的一貫性と漸近正規性を確立する。
  • 実世界のネットワークデータ(サイバーセキュリティグラフを含む)にフレームワークを適用し、スペクトル埋め込みの後にガウス・ミックスモデルやt-SNE可視化を用いる。
  • 埋め込みベクトル間の内積(または不定内積)をリンク予測のためのエッジ確率推定値として用いる。

実験結果

リサーチクエスチョン

  • RQ1標準的なランダムドット積産業グラフよりも一般化されたランダムグラフモデル下で、スペクトル埋め込みを一貫性のある潜在位置推定手順として解釈できるか?
  • RQ2GRDPGモデルは、「対極を惹かれ合う」やコア-パーサー構造のような非同種結合性のパターンをどのように処理するか?
  • RQ3GRDPGモデル下でのスペクトル埋め込みの漸近的分布は何か?また、一貫性のある推定をサポートするか?
  • RQ4GRDPGモデルは、標準的またはミックスドメンバーシップのストークスティックブロックモデルよりも豊かな潜在ネットワーク構造を明らかにできるか?
  • RQ5GRDPGは、標準的なランダムドット積産業グラフに比べてリンク予測性能を向上させるか?

主な発見

  • GRDPGモデル下でのスペクトル埋め込みは、同定可能性を除き、一様に一貫性のある潜在位置推定を提供し、漸近的にガウス分布に従う誤差を有する。
  • GRDPGモデルは、同種結合性と異種結合性の両方をサポートし、標準的なランダムドット積産業グラフがモデル化できない負の固有値を含むケースも扱える。
  • ストークスティックブロックモデル下では、コミュニティが明確に分離されていない場合に、K-meansの代わりにガウス・ミックスモデルを用いる正当性が示される。
  • ミックスドメンバーシップモデル下では、GRDPGは最小体積包囲む単体のフィッティングを可能にし、非負定値仮定を超えた先行の推奨事項を拡張する。
  • サイバーセキュリティネットワークにおける実験的結果から、GRDPGベースの埋め込みはポート活動に関連する潜在構造を明らかにし、標準的なストークスティックブロックモデルが予測するよりも豊かな幾何構造を示している。
  • リンク予測性能は、GRDPG埋め込みを用いることで、標準的なランダムドット積産業グラフに比べて向上しており、特に複雑で非同種結合性の強いネットワークにおいて顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。