Skip to main content
QUICK REVIEW

[论文解读] Completing Any Low-rank Matrix, Provably

Yudong Chen, Srinadh Bhojanapalli|arXiv (Cornell University)|Jun 12, 2013
Sparse and Compressive Sensing Techniques参考文献 26被引用 22
一句话总结

本文提出了一种针对任意低秩矩阵的可证明精确矩阵补全方法,采用一种偏差采样方案,其中观测某个条目的概率与其所在行和列的杠杆度分数之和成正比。研究表明,通过核范数最小化,$O(nrackepsilon^2 n)$ 个样本足以实现精确恢复,并证明该采样策略几乎是必要的,从而消除了先前工作中所需的非一致性假设。

ABSTRACT

Matrix completion, i.e., the exact and provable recovery of a low-rank matrix from a small subset of its elements, is currently only known to be possible if the matrix satisfies a restrictive structural constraint---known as {\em incoherence}---on its row and column spaces. In these cases, the subset of elements is sampled uniformly at random. In this paper, we show that {\em any} rank-$ r $ $ n$-by-$ n $ matrix can be exactly recovered from as few as $O(nr \log^2 n)$ randomly chosen elements, provided this random choice is made according to a {\em specific biased distribution}: the probability of any element being sampled should be proportional to the sum of the leverage scores of the corresponding row, and column. Perhaps equally important, we show that this specific form of sampling is nearly necessary, in a natural precise sense; this implies that other perhaps more intuitive sampling schemes fail. We further establish three ways to use the above result for the setting when leverage scores are not known extit{a priori}: (a) a sampling strategy for the case when only one of the row or column spaces are incoherent, (b) a two-phase sampling procedure for general matrices that first samples to estimate leverage scores followed by sampling for exact recovery, and (c) an analysis showing the advantages of weighted nuclear/trace-norm minimization over the vanilla un-weighted formulation for the case of non-uniform sampling.

研究动机与目标

  • 消除低秩矩阵补全中限制性较强的非一致性假设,该假设使得先前的方法仅适用于特定结构的矩阵。
  • 设计一种能根据矩阵结构自适应调整的采样方案,优先选择杠杆度分数较高的条目,从而确保任意低秩矩阵的恢复。
  • 在非均匀采样下建立精确恢复的理论保证,表明基于杠杆度分数的采样几乎是相干矩阵恢复的必要条件。
  • 为杠杆度分数事先未知的情况提供实用策略,包括两阶段采样和加权核范数最小化。
  • 展示在非均匀采样下,加权核范数最小化相较于标准核范数最小化的理论优势。

提出的方法

  • 提出一种偏差采样分布,其中条目 $(i,j)$ 的采样概率与其底层矩阵中第 $i$ 行和第 $j$ 列的杠杆度分数之和成正比。
  • 引入一种新颖的浓度不等式,涉及加权 $\ell_{\infty,2}$ 矩阵范数,用于分析非均匀采样下的恢复误差。
  • 应用矩阵伯恩斯坦不等式,控制采样算子与其期望之间的偏差,从而获得高概率恢复保证。
  • 提出一种两阶段自适应采样策略:首先进行均匀采样以估计杠杆度分数,然后根据估计结果进行杠杆度分数导向的采样,以实现精确恢复。
  • 构建一种加权核范数最小化框架,其中权重根据采样概率选择,以恢复最优样本复杂度。
  • 通过建立所需采样偏差的下界,证明所提出的采样方案对相干矩阵而言几乎是必要的。

实验结果

研究问题

  • RQ1是否可以通过非均匀采样策略,实现对违反非一致性假设的任意矩阵的低秩矩阵补全?
  • RQ2是否存在一种采样分布,能够以接近信息论最小值的样本复杂度,实现任意低秩矩阵的精确恢复?
  • RQ3恢复相干矩阵所需的最小采样偏差是多少?所提出的基于杠杆度分数的采样方案在这一意义上是否最优?
  • RQ4当杠杆度分数事先未知时,如何在实践中实现基于杠杆度分数的采样?
  • RQ5在非均匀采样下,加权核范数最小化相较于标准核范数最小化具有何种理论优势?

主要发现

  • 任何秩为 $r$ 的 $n\times n$ 矩阵,均可通过基于杠杆度分数比例概率采样的 $O(nrackepsilon^2 n)$ 个条目,利用核范数最小化实现精确恢复。
  • 所提出的采样方案对相干矩阵的精确恢复几乎是必要的,意味着其他采样策略在一般情况下会失败。
  • 对于列空间非一致且行相干性任意的矩阵,即使事先不知道杠杆度分数,也存在一种可证明正确的采样策略,其样本复杂度接近最优。
  • 两阶段自适应采样策略——先进行均匀采样以估计杠杆度分数,再基于估计结果进行杠杆度分数导向采样——其性能可与最优方案相媲美,并在相干矩阵上显著优于均匀采样。
  • 当使用采样概率正确加权时,加权核范数最小化可实现与无权重最小化相同的样本复杂度,为其实验成功提供了理论依据。
  • 理论分析表明,样本复杂度上界 $O(nrackepsilon^2 n)$ 在 $\log^2 n$ 因子内是最优的,与 $n\times n$ 秩 $r$ 矩阵的自由度相匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。