Skip to main content
QUICK REVIEW

[論文レビュー] Hypothesis Testing for Equality of Latent Positions in Random Graphs

Xin-Jie Du, Minh Tang|arXiv (Cornell University)|May 23, 2021
Complex Network Analysis Techniques参考文献 46被引用数 4
ひとこと要約

本稿では、隣接行列または正規化ラプラシアン行列のスペクトル埋め込みからのマハラノビス距離を用いて、一般化されたランダムドット積グラフにおける潜在位置の等価性に関する仮説検定を提案する。弱い正則性条件の下で、帰無仮説および局所代替仮説の下で、検定統計量は漸近的にカイ二乗分布に従い、スチューデンティックブロックモデル(SBM)、度数補正付きバージョン(DC-SBM)、Erdős–Rényi(ER)モデルの間のモデル選択が可能になる。パワー分析のための理論的非心パラメータが導出されている。

ABSTRACT

We consider the hypothesis testing problem that two vertices $i$ and $j$ of a generalized random dot product graph have the same latent positions, possibly up to scaling. Special cases of this hypothesis test include testing whether two vertices in a stochastic block model or degree-corrected stochastic block model graph have the same block membership vectors, or testing whether two vertices in a popularity adjusted block model have the same community assignment. We propose several test statistics based on the empirical Mahalanobis distances between the $i$th and $j$th rows of either the adjacency or the normalized Laplacian spectral embedding of the graph. We show that, under mild conditions, these test statistics have limiting chi-square distributions under both the null and local alternative hypothesis, and we derived explicit expressions for the non-centrality parameters under the local alternative. Using these limit results, we address the model selection problems including choosing between the standard stochastic block model and its degree-corrected variant, and choosing between the ER model and stochastic block model. The effectiveness of our proposed tests are illustrated via both simulation studies and real data applications.

研究の動機と目的

  • ランダムグラフ内の2つの頂点がスケーリングを除いて等しい潜在位置を持つかどうかを統計的仮説検定で評価すること。
  • スチューデンティックブロックモデル(SBM)、度数補正付きSBM(DC-SBM)、Erdős–Rényi(ER)モデルの間のモデル選択課題に対処すること。
  • 一般化されたランダムドット積グラフ(GRDPG)フレームワークにおいて、頂点レベルの潜在位置の等価性について漸近的に有効な推論を提供すること。
  • 頂点間の構造的類似性をテストすることで、頂点ノミネーションやロール発見への応用を可能にすること。
  • 局所代替仮説の下での非心パラメータを導出し、パワー分析と実データでの検証を可能にすること。

提案手法

  • 隣接行列または正規化ラプラシアン行列からのスペクトル埋め込みのi番目およびj番目の行間の実証的マハラノビス距離に基づく検定統計量を提案する。
  • グラフ行列のスペクトル埋め込みを用いて、GRDPGモデル下で潜在位置の一致推定値を取得する。
  • 帰無仮説および局所代替仮説の下で、検定統計量の漸近的カイ二乗分布を導出し、明示的な非心パラメータを提供する。
  • 頂点レベルの潜在位置の等価性(スケーリングを除く)に関する仮説検定を、極限分布を用いて実施する。
  • スパarsityレベルの変動に応じた実験的サイズおよびパワーの評価のため、500回のモンテカルロシミュレーションを実施する。
  • 政治ブログデータを用いて理論的結果を検証し、実効的パワーと理論的パワーの間で良好な一致を示した。

実験結果

リサーチクエスチョン

  • RQ1一般化されたランダムドット積グラフにおいて、スペクトル埋め込みを用いて、2つの頂点がスケーリングを除いて同じ潜在位置を持つかどうかを検定できるか?
  • RQ2帰無仮説および局所代替仮説の下で、頂点ペアの等価性に関するマハラノビス距離に基づく検定統計量の漸近的分布は何か?
  • RQ3これらの検定統計量を用いて、SBM、DC-SBM、ERモデルなどの競合するネットワークモデルの間でモデル選択は可能か?
  • RQ4局所代替仮説の下で、非心カイ二乗分布の明示的な非心パラメータは何か? そして、それらは検定パワーにどのように影響するか?
  • RQ5特にスパarsityレベルの変動に伴って、漸近的近似は有限標本においてどの程度有効か?

主な発見

  • 帰無仮説の下で、検定統計量 $ T_{\text{out}} $、$ T_{\text{in}} $、$ T_{\text{both}} $ はそれぞれ $ \chi^2_3 $、$ \chi^2_3 $、$ \chi^2_6 $ 分布に漸近的に従い、実効的ヒストограмは理論的カイ二乗密度とよく一致する。
  • すべてのスパarsityレベルで、$ T_{\text{out}} $ および $ T_{\text{both}} $ の実効的サイズ推定値は、名目水準 0.05 に近く、サイズコントロールが適切に行われていることを確認した。
  • $ T_{\text{in}} $ および $ T_{\text{both}} $ の実効的パワーはスパarsityが高くなるにつれて増加し、$ \rho = 1.0 $ でそれぞれ 0.956 および 0.844 に達した。これは理論的パワー予測とよく一致した。
  • 局所代替仮説の下での理論的非心パラメータは正確に推定され、観測されたパワーと強く相関しており、漸近理論の妥当性が裏付けられた。
  • 政治ブログデータセットにおいて、提案手法は頂点間の構造的類似性を的確に同定し、頂点ノミネーションなどの実世界応用における有効性を裏付けた。
  • 本手法により、頂点レベルの潜在位置の等価性テストに基づいて、SBM、DC-SBM、ERモデルの間の効果的なモデル選択が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。