Skip to main content
QUICK REVIEW

[論文レビュー] Online matrix factorization for Markovian data and applications to Network Dictionary Learning

Hanbaek Lyu, Deanna Needell|arXiv (Cornell University)|Nov 5, 2019
Sparse and Compressive Sensing Techniques参考文献 48被引用数 11
ひとこと要約

本稿では、データが弱い混合条件を満たすマルコフ連鎖としてモデル化される依存的な場合でも、期待損失関数の臨界点へほとんど確実に収束するオンライン行列分解(OMF)アルゴリズムを提案する。この手法により、サブサンプリングを要せず、依存するデータストリームからの効率的な特徴抽出が可能となり、実世界のネットワークにおけるネットワーク辞書学習を用いた局所的サブグラフパターン(モチーフ)のオンライン抽出およびノイズ除去に応用される。

ABSTRACT

Online Matrix Factorization (OMF) is a fundamental tool for dictionary learning problems, giving an approximate representation of complex data sets in terms of a reduced number of extracted features. Convergence guarantees for most of the OMF algorithms in the literature assume independence between data matrices, and the case of dependent data streams remains largely unexplored. In this paper, we show that a non-convex generalization of the well-known OMF algorithm for i.i.d. stream of data in \citep{mairal2010online} converges almost surely to the set of critical points of the expected loss function, even when the data matrices are functions of some underlying Markov chain satisfying a mild mixing condition. This allows one to extract features more efficiently from dependent data streams, as there is no need to subsample the data sequence to approximately satisfy the independence assumption. As the main application, by combining online non-negative matrix factorization and a recent MCMC algorithm for sampling motifs from networks, we propose a novel framework of Network Dictionary Learning, which extracts ``network dictionary patches' from a given network in an online manner that encodes main features of the network. We demonstrate this technique and its application to network denoising problems on real-world network data.

研究の動機と目的

  • データが独立同分布(i.i.d.)ではなく依存的である場合のオンライン行列分解(OMF)に対する収束保証のギャップを埋める。
  • 弱い混合条件を満たすマルコフ連鎖のデータストリームに対して、OMFの理論的収束性を拡張する。
  • 局所的サブグラフパターン(モチーフ)をオンラインで抽出できる、ネットワークデータ解析のための新規フレームワーク「ネットワーク辞書学習(NDL)」を構築する。
  • 独立性を強制するためにサブサンプリングを行わず、依存するネットワークデータからの効率的かつリアルタイムな特徴抽出を可能にする。
  • マルコフ連鎖の依存性を想定したOMFの一般化に基づき、提案されたNDLフレームワークの理論的収束保証を提供する。

提案手法

  • [33]のOMFアルゴリズムの非凸型一般化を、下位のマルコフ連鎖に依存するストリーミングデータに適用する。
  • マルコフ連鎖に弱い混合条件を課したもとで収束解析を導入し、期待損失関数の臨界点へのほとんど確実な収束を保証する。
  • オンライン非負行列分解(ONMF)と、複雑なネットワークからのネットワークモチーフ抽出に最近開発されたMCMCアルゴリズムを組み合わせる。
  • MCMCによって生成されたモチーフストリームをOMFアルゴリズムの入力とし、オンラインでネットワークモチーフの辞書を学習する。
  • 非凸性下でも収束を維持するために、制約集合と楕円体型の妥当性領域を用いた投影勾配更新ルールを実装する。
  • 部分列収束の議論と正規凸体解析を用いて、反復の極限点が目的関数の臨界点であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1データがi.i.d.ではなく依存的である場合、オンライン行列分解(OMF)は臨界点に収束するか?
  • RQ2弱い混合条件を満たすマルコフ連鎖のデータモデル下でも、OMFの収束性は成立するか?
  • RQ3提案されたOMFフレームワークは、ネットワークデータから意味のある局所的パターンを効果的に抽出できるか?
  • RQ4独立性を保証するためにサブサンプリングを行わず、オンラインでストリーミング形式でネットワークの辞書を学習することは可能か?
  • RQ5提案されたネットワーク辞書学習(NDL)フレームワークの収束性に対して、どのような理論的保証を確立できるか?

主な発見

  • 提案されたOMFアルゴリズムは、弱い混合条件を満たすマルコフ連鎖によって生成されるデータに対しても、期待損失関数の臨界点の集合へほとんど確実に収束する。
  • データのサブサンプリングを要せず、自然に依存するデータストリームからの特徴抽出がより効率的に行える。
  • 本手法は、局所的サブグラフパターン(モチーフ)をオンラインで抽出できる新規なネットワーク辞書学習(NDL)フレームワークを介してネットワークデータに応用される。
  • NDLフレームワークは、実世界のネットワークデータにおいて効果的なネットワークノイズ除去を達成し、実用的価値を示している。
  • 主な理論的結果(補題6.1)の系として、NDLアルゴリズムの収束保証が確立されている(補題6.1)。
  • 本フレームワークはイジングスピン配置および実世界のネットワークで検証され、相関のあるデータを効果的に処理する強靭性と効率性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。