Skip to main content
QUICK REVIEW

[论文解读] Online matrix factorization for Markovian data and applications to Network Dictionary Learning

Hanbaek Lyu, Deanna Needell|arXiv (Cornell University)|Nov 5, 2019
Sparse and Compressive Sensing Techniques参考文献 48被引用 11
一句话总结

本文提出了一种在线矩阵分解(OMF)算法,即使在数据呈依赖性(建模为满足温和混合条件的马尔可夫链)时,也能以几乎必然的方式收敛到期望损失函数的临界点。该方法可在不进行子采样的情况下,高效地从依赖性数据流中提取特征,并应用于网络字典学习,实现实时提取网络基序和在真实网络中的去噪。

ABSTRACT

Online Matrix Factorization (OMF) is a fundamental tool for dictionary learning problems, giving an approximate representation of complex data sets in terms of a reduced number of extracted features. Convergence guarantees for most of the OMF algorithms in the literature assume independence between data matrices, and the case of dependent data streams remains largely unexplored. In this paper, we show that a non-convex generalization of the well-known OMF algorithm for i.i.d. stream of data in \citep{mairal2010online} converges almost surely to the set of critical points of the expected loss function, even when the data matrices are functions of some underlying Markov chain satisfying a mild mixing condition. This allows one to extract features more efficiently from dependent data streams, as there is no need to subsample the data sequence to approximately satisfy the independence assumption. As the main application, by combining online non-negative matrix factorization and a recent MCMC algorithm for sampling motifs from networks, we propose a novel framework of Network Dictionary Learning, which extracts ``network dictionary patches' from a given network in an online manner that encodes main features of the network. We demonstrate this technique and its application to network denoising problems on real-world network data.

研究动机与目标

  • 为解决在线矩阵分解(OMF)在数据依赖而非独立同分布(i.i.d.)时缺乏收敛性保证的问题。
  • 在温和混合条件下,将OMF的理论收敛性扩展至马尔可夫性数据流。
  • 提出一种新颖的网络数据分析框架——网络字典学习(NDL),以在线方式提取局部子图模式(基序)。
  • 实现在不进行子采样以强制独立性的前提下,对依赖性网络数据进行高效、实时的特征提取。
  • 通过在马尔可夫依赖下对OMF的推广,为所提出的NDL框架提供理论收敛保证。

提出的方法

  • 针对依赖于底层马尔可夫链的流数据,提出[33]中OMF算法的非凸推广。
  • 在马尔可夫链满足温和混合条件的假设下,建立收敛性分析,确保几乎必然收敛至期望损失函数的临界点。
  • 将在线非负矩阵分解(ONMF)与一种近期的MCMC算法相结合,用于从复杂网络中采样网络基序。
  • 将MCMC生成的基序数据流作为输入,输入至OMF算法,以在线方式学习网络基序字典。
  • 采用带约束集和椭球可行性区域的投影梯度更新规则,以在非凸条件下维持收敛性。
  • 利用子序列收敛性论证与法锥分析,证明迭代序列的极限点为目标函数的临界点。

实验结果

研究问题

  • RQ1当数据为依赖性而非i.i.d.时,在线矩阵分解能否收敛至临界点?
  • RQ2在具有温和混合条件的马尔可夫数据模型下,OMF的收敛性是否仍然成立?
  • RQ3所提出的OMF框架能否有效应用于从网络数据中提取有意义的局部模式?
  • RQ4是否可能在不进行子采样以保证独立性的前提下,以在线流式方式学习网络基序字典?
  • RQ5为所提出的网络字典学习框架的收敛性可建立何种理论保证?

主要发现

  • 所提出的OMF算法即使在数据由满足温和混合条件的马尔可夫链生成时,也能以几乎必然的方式收敛至期望损失函数的临界点集合。
  • 该收敛结果无需数据子采样,从而实现了对自然依赖性数据流的更高效特征提取。
  • 该方法通过一种新颖的网络字典学习(NDL)框架应用于网络数据,实现了在线方式下对局部子图模式(基序)的学习。
  • NDL框架在真实世界网络数据上实现了有效的网络去噪,展示了其实际应用价值。
  • NDL算法的收敛性保证作为主理论结果的推论(推论6.1)得以建立。
  • 该框架在伊辛自旋构型和真实世界网络上进行了验证,表明其在处理相关数据时具有鲁棒性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。