Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Gradient Descent for Relational Logistic Regression via Partial Network Crawls

Jiasen Yang, Bruno Ribeiro|arXiv (Cornell University)|Jul 24, 2017
Bayesian Modeling and Causal Inference参考文献 18被引用数 4
ひとこと要約

本稿では、部分的ネットワーククローリングを用いて不偏なパrameter推定と有効な信頼区間を達成するための、関係的ロジスティック回帰(RLR)における確率的勾配降下法(SGD)を提案する。シードノードからのランダムウォークツアーにおける再生過程を活用することで、一般的なクローリング戦略に内在するサンプリングバイアスを是正し、有限の分散を伴う漸近的に不偏な対数尤度および勾配推定を保証する。

ABSTRACT

Research in statistical relational learning has produced a number of methods for learning relational models from large-scale network data. While these methods have been successfully applied in various domains, they have been developed under the unrealistic assumption of full data access. In practice, however, the data are often collected by crawling the network, due to proprietary access, limited resources, and privacy concerns. Recently, we showed that the parameter estimates for relational Bayes classifiers computed from network samples collected by existing network crawlers can be quite inaccurate, and developed a crawl-aware estimation method for such models (Yang, Ribeiro, and Neville, 2017). In this work, we extend the methodology to learning relational logistic regression models via stochastic gradient descent from partial network crawls, and show that the proposed method yields accurate parameter estimates and confidence intervals.

研究の動機と目的

  • アクセス制限のため部分的ネットワーククローリングしか得られない状況において、関係的ロジスティック回帰におけるバイアスのあるパrameter推定問題に対処すること。
  • サンプルデータから全ネットワークの対数尤度およびその勾配の不偏推定を実現する確率的勾配降下法を開発すること。
  • サンプリングバイアスが存在するにもかかわらず、正確な統計的推論を可能にするために有効な信頼区間を構築すること。
  • より一般かつ広く使われている関係的ロジスティック回帰モデルへの、先行研究の関係的ベイズ分類器の拡張を図ること。
  • 提案手法が、クロールデータ上で単純なSGDよりも低い推定誤差と高い信頼区間カバレッジを達成することを示すこと。

提案手法

  • 本手法は、シードノードの集合から開始するランダムウォークベースのネットワーククローリング戦略を用い、シードノード集合をスーパーノードとして扱い、再生過程としてプロセスをモデル化する。
  • シードノードからの明示的な寄与と、ツアーに基づくサンプリングを用いた残りのネットワークに対する不偏推定器を組み合わせることで、全ネットワークの対数尤度を推定する。
  • テイル対数尤度の主要な推定器は $ \widehat{\mathcal{L}}^{t} = \frac{d_{\mathcal{S}}}{m}\sum_{k=1}^{m}\sum_{t=2}^{\xi_k - 1}\frac{g(v^{(k)}_t)}{d_{v^{(k)}_t}} $ であり、$ d_{\mathcal{S}} $ はシードノードからの全出次数を表す。
  • 勾配は、シードノードとツアー内のサンプルノードからの寄与の線形結合により推定され、勾配推定の不偏性が保証される。
  • 理論的裏付けは再生報酬定理に依拠し、推定器の期待値が全ネットワークにおける真の対数尤度に等しいことを示している。
  • 本手法は勾配推定の分散が有限であることを保証し、標準的なSGDの条件下で真のパrameter値への漸近的収束を保証する。

実験結果

リサーチクエスチョン

  • RQ1部分的ネットワーククローリングで収集されたデータ上でトレーニングされた際、関係的ロジスティック回帰のための確率的勾配降下法を不偏にできるか?
  • RQ2ランダムウォークやフォレストファイアのような一般的なクローリング手法によるサンプリングバイアスは、パrameter推定でどのように是正できるか?
  • RQ3部分的ネットワークデータしか入手できない状況でも、モデルパラメータのための有効な信頼区間を構築できるか?
  • RQ4提案手法は、クロールデータ上で単純なSGDよりも推定精度と区間カバレッジの両面で優れているか?
  • RQ5提案された推定器の不偏性および収束性について、どのような理論的保証を提供できるか?

主な発見

  • 提案手法は、部分的ネットワーククローリングからのデータでトレーニングされた場合でも、全ネットワークにおける対数尤度関数およびその勾配の不偏推定を実現する。
  • 本手法は勾配推定の分散が有限であることを保証し、十分に小さい学習率のもとでSGDが真のパrameter値に収束することを可能にする。
  • 理論的分析により、ランダムウォークツアーにおける再生報酬定理を用いて、推定器が漸近的不偏性を満たすことが証明された。
  • 大規模ネットワークデータセットを用いた実験的評価では、クロールデータ上で単純なSGDと比較して一貫して低いパラメータ推定誤差を示した。
  • 信頼区間のカバレッジ確率が高く、統計的信頼性の向上が示された。
  • 本手法は、関係的ベイズ分類器へのバイアス補正推定の拡張を、より一般かつ広く使われている関係的ロジスティック回帰モデルへ成功裏に拡張した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。