Skip to main content
QUICK REVIEW

[论文解读] Stochastic Gradient Descent for Relational Logistic Regression via Partial Network Crawls

Jiasen Yang, Bruno Ribeiro|arXiv (Cornell University)|Jul 24, 2017
Bayesian Modeling and Causal Inference参考文献 18被引用 4
一句话总结

本文提出了一种用于关系逻辑回归(RLR)的随机梯度下降(SGD)方法,通过部分网络爬取实现无偏参数估计和有效的置信区间。该方法利用从种子节点出发的随机游走巡回中的更新过程,纠正了常见爬取策略中固有的采样偏差,确保对数似然和梯度估计在渐近意义上无偏且方差有限。

ABSTRACT

Research in statistical relational learning has produced a number of methods for learning relational models from large-scale network data. While these methods have been successfully applied in various domains, they have been developed under the unrealistic assumption of full data access. In practice, however, the data are often collected by crawling the network, due to proprietary access, limited resources, and privacy concerns. Recently, we showed that the parameter estimates for relational Bayes classifiers computed from network samples collected by existing network crawlers can be quite inaccurate, and developed a crawl-aware estimation method for such models (Yang, Ribeiro, and Neville, 2017). In this work, we extend the methodology to learning relational logistic regression models via stochastic gradient descent from partial network crawls, and show that the proposed method yields accurate parameter estimates and confidence intervals.

研究动机与目标

  • 解决由于访问限制仅能获取部分网络爬取数据时,关系逻辑回归中参数估计偏差的问题。
  • 开发一种随机梯度下降方法,从采样数据中生成对全网对数似然及其梯度的无偏估计。
  • 通过构建有效的置信区间,实现在存在采样偏差情况下的准确统计推断。
  • 将先前关于关系贝叶斯分类器的研究扩展到更通用且广泛使用的关联逻辑回归模型。
  • 证明所提方法在估计误差和置信区间覆盖度方面优于在爬取数据上直接应用的朴素SGD。

提出的方法

  • 该方法采用基于随机游走的网络爬取策略,从一组种子节点出发采样网络,将种子集视为超节点,将该过程建模为更新过程。
  • 通过结合种子节点的显式已知贡献与基于巡回采样的其余网络部分的无偏估计,来估计全网对数似然。
  • 尾部对数似然的关键估计量为 $ \widehat{\mathcal{L}}^{t} = \frac{d_{\mathcal{S}}}{m}\sum_{k=1}^{m}\sum_{t=2}^{\xi_k - 1}\frac{g(v^{(k)}_t)}{d_{v^{(k)}_t}} $,其中 $ d_{\mathcal{S}} $ 为从种子节点出发的总出度。
  • 通过对种子节点和巡回中采样节点的贡献进行线性组合,估计对数似然的梯度,从而确保梯度估计的无偏性。
  • 理论依据依赖于更新奖励定理,表明该估计量的期望值等于全网的真实对数似然。
  • 该方法确保梯度估计具有有限方差,并在标准SGD条件下保证渐近收敛至真实参数值。

实验结果

研究问题

  • RQ1当在通过部分网络爬取获得的数据上训练时,能否使关系逻辑回归的随机梯度下降方法实现无偏?
  • RQ2如何纠正常见爬取方法(如随机游走和森林燃烧法)带来的采样偏差?
  • RQ3当仅有部分网络数据时,能否为模型参数构建有效的置信区间?
  • RQ4所提方法在估计精度和区间覆盖度方面是否优于在爬取数据上直接应用的朴素SGD?
  • RQ5该估计量的无偏性和收敛性可提供哪些理论保证?

主要发现

  • 所提方法即使在仅基于部分网络爬取数据训练时,也能对全网对数似然函数及其梯度实现无偏估计。
  • 该方法确保梯度估计具有有限方差,从而在学习率足够小时可保证SGD收敛至真实参数值。
  • 理论分析证明,利用随机游走巡回上的更新奖励定理,该估计量满足渐近无偏性的条件。
  • 在大规模网络数据集上的实证评估表明,与在爬取数据上直接应用的朴素SGD相比,该方法的参数估计误差始终更低。
  • 该方法实现了更高的置信区间覆盖概率,表明其统计可靠性更优。
  • 该方法成功将偏差校正估计从关系贝叶斯分类器推广至更通用的关系逻辑回归模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。