Skip to main content
QUICK REVIEW

[论文解读] Consistency and Asymptotic Normality of Stochastic Block Models Estimators from Sampled Data

Mahendra Mariadassou, Timothée Tabouy|arXiv (Cornell University)|Mar 28, 2019
Random Matrices and Applications参考文献 29被引用 9
一句话总结

该论文在MCAR抽样机制下,建立了带权边的随机块模型中最大似然估计与变分估计的相合性与渐近正态性。证明了只要抽样概率满足 $\rho \gg \log(n)/n$,估计量仍保持有效性与渐近正态性,将理论保证扩展至存在不完整观测的加权网络。

ABSTRACT

Statistical analysis of network is an active research area and the literature counts a lot of papers concerned with network models and statistical analysis of networks. However, very few papers deal with missing data in network analysis and we reckon that, in practice, networks are often observed with missing values. In this paper we focus on the Stochastic Block Model with valued edges and consider a MCAR setting by assuming that every dyad (pair of nodes) is sampled identically and independently of the others with probability $\ ho > 0$. We prove that maximum likelihood estimators and its variational approximations are consistent and asymptotically normal in the presence of missing data as soon as the sampling probability $\ ho$ satisfies $\ ho\\gg\\log(n)/n$.

研究动机与目标

  • 在由于缺失值导致边数据部分观测的情况下,建立随机块模型参数估计的理论保证。
  • 将此前仅限于二值或完全观测网络的一致性与渐近正态性结果,扩展至存在缺失数据的带权边情形。
  • 分析缺失数据对具有潜在块结构的网络模型中最大似然估计与变分估计的影响。
  • 提供在成对观测不完整的情况下,估计量仍保持一致与渐近正态性的条件。
  • 适应浓度不等式与渐近理论,以处理在抽样机制下具有无界、非高斯边权的情形。

提出的方法

  • 将网络建模为带权边的随机块模型,其中每对节点在MCAR(完全随机缺失)机制下以概率 $\rho$ 独立观测。
  • 使用最大似然估计(MLE)与变分近似(VE)估计模型参数,通过调整似然函数以考虑缺失的成对观测。
  • 应用次指数浓度不等式,控制观测边权与其模型期望之间的偏差。
  • 对潜在分配向量 $\mathbf{z}^\star$ 施加正则性条件,以确保局部可辨识性,并控制接近真实分配的配置数量。
  • 利用多项式比例最大似然估计的局部渐近正态性,以界定真实配置与任一替代配置之间的似然比。
  • 通过证明估计误差在 $n^{-1/2}$ 速率下依分布收敛,推导出渐近正态性,条件为 $\rho \gg \log(n)/n$。

实验结果

研究问题

  • RQ1在何种抽样条件下,带权边的随机块模型中MLE与变分估计量仍保持一致?
  • RQ2当边在随机缺失下,能否为估计量建立渐近正态性,特别是针对无界边权?
  • RQ3抽样概率 $\rho$ 如何影响估计量的收敛速率与渐近分布?
  • RQ4在存在缺失数据时,为处理无界、非高斯边权,需对浓度不等式进行何种修改?
  • RQ5二值SBM的理论保证在部分观测下在多大程度上可推广至加权SBM?

主要发现

  • 在MCAR抽样下,只要 $\rho \gg \log(n)/n$,带权边的随机块模型中最大似然估计与变分估计量即具有一致性。
  • 在相同抽样条件下,估计量的渐近正态性得以建立,收敛速率为 $n^{-1/2}$。
  • 证明依赖于无界、非高斯随机变量之和的次指数浓度不等式,这些变量源于加权边。
  • 真实配置与任一替代配置之间的似然比以哈密顿距离的指数形式衰减,控制方式为 $\mathcal{O}_P(1)\exp\{M_{c/4}\|\mathbf{z}-\mathbf{z}^\star\|_0\}$。
  • 通过将浓度与渐近正态性论证适配于无界边权,该理论框架成功将二值SBM的结果推广至加权SBM。
  • 条件 $\rho \gg \log(n)/n$ 确保缺失成对观测的数量不会主导估计过程,从而保持统计效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。