Skip to main content
QUICK REVIEW

[论文解读] Nearly-optimal Robust Matrix Completion

Yeshwanth Cherapanamjeri, Kartik Gupta|arXiv (Cornell University)|Jun 23, 2016
Sparse and Compressive Sensing Techniques参考文献 9被引用 20
一句话总结

该论文提出了一种用于鲁棒矩阵补全(RMC)的投影梯度下降算法,通过交替进行低秩矩阵估计和硬阈值化操作来清洗被污染的条目。该方法实现了几乎最优的样本复杂度 $O(rn\log n)$ 和几乎最优的污染容忍度 $O(1/\mu^2 r)$,时间复杂度接近线性 $O(|\Omega|r + (m+n)r^2 + r^3)$,显著优于以往基于凸松弛的方法。

ABSTRACT

In this paper, we consider the problem of Robust Matrix Completion (RMC) where the goal is to recover a low-rank matrix by observing a small number of its entries out of which a few can be arbitrarily corrupted. We propose a simple projected gradient descent method to estimate the low-rank matrix that alternately performs a projected gradient descent step and cleans up a few of the corrupted entries using hard-thresholding. Our algorithm solves RMC using nearly optimal number of observations as well as nearly optimal number of corruptions. Our result also implies significant improvement over the existing time complexity bounds for the low-rank matrix completion problem. Finally, an application of our result to the robust PCA problem (low-rank+sparse matrix separation) leads to nearly linear time (in matrix dimensions) algorithm for the same; existing state-of-the-art methods require quadratic time. Our empirical results corroborate our theoretical results and show that even for moderate sized problems, our method for robust PCA is an an order of magnitude faster than the existing methods.

研究动机与目标

  • 解决鲁棒矩阵补全(RMC)问题,即从少量稀疏污染条目中恢复低秩矩阵。
  • 实现几乎最优的样本复杂度 $O(rn\\log n)$ 和几乎最优的污染比例 $O(1/\mu^2 r)$,与信息论极限一致。
  • 相比现有基于凸松弛的方法(其复杂度为 $O(m^2n)$),降低时间复杂度。
  • 通过利用RMC的解,实现更快的鲁棒主成分分析(RPCA),达到接近线性的时间复杂度。
  • 为非凸、交替的投影梯度方法在低秩与稀疏集合上的收敛性提供可证明的保证。

提出的方法

  • 使用投影梯度下降(PGD)框架,从未完全观测且被污染的条目中估计低秩矩阵 $L^*$。
  • 在低秩矩阵上执行投影梯度步长与硬阈值化步长之间交替进行,以识别并修正被污染的条目。
  • 对非凸集合进行交替投影:秩-$r$ 矩阵与稀疏矩阵,避免使用凸松弛。
  • 采用一种新颖的误差分析方法,同时考虑缺失条目与稀疏污染的影响,二者在恢复过程中相互作用。
  • 采用采样模型:$\Omega$ 为均匀随机采样,$S^*$ 的支撑集位于 $\Omega$ 内,每行/每列的污染条目比例为 $\rho = O(1/\mu^2 r)$。
  • 推导出依赖于条件数 $\kappa$ 的对数复杂度的理论边界,与以往方法相比,其复杂度在 $\kappa$ 上仅呈多项式对数增长,而非二次或五次方增长。

实验结果

研究问题

  • RQ1能否在每行/每列含有 $O(1/\mu^2 r)$ 比例污染条目的前提下,仅使用 $O(rn\log n)$ 观测条目,精确求解RMC问题?
  • RQ2能否将RMC的时间复杂度降低至与矩阵维度近乎线性,同时保持最优样本复杂度与污染容忍度?
  • RQ3在标准非相干性假设下,非凸投影梯度方法结合交替硬阈值化是否能实现RMC的可证明恢复?
  • RQ4与基于凸松弛的方法相比,该方法在样本复杂度、污染容忍度和运行时间方面表现如何?
  • RQ5能否利用RMC算法实现近乎线性时间的鲁棒主成分分析(RPCA)?

主要发现

  • 所提算法实现了几乎最优的样本复杂度 $O(rn\log n)$,与信息论下限仅相差对数因子。
  • 可容忍每行/每列高达 $O(1/\mu^2 r)$ 比例的污染条目,该容忍度在信息论上已接近最优(仅差常数因子)。
  • 运行时间为 $O(|\Omega|r + (m+n)r^2 + r^3)$,与矩阵维度近乎线性,显著快于以往基于凸方法的 $O(m^2n)$ 复杂度。
  • 该方法将鲁棒主成分分析(RPCA)的时间复杂度降低至近乎线性,而现有最先进方法需二次时间。
  • 实验结果表明,即使在中等规模问题上,PG-RMC算法的运行速度也比现有RPCA方法快一个数量级,在低采样率与高污染率条件下仍保持高恢复概率。
  • 该算法的样本复杂度对最终误差 $\epsilon$ 仅呈对数依赖,其运行时间与样本复杂度对条件数 $\kappa$ 的依赖也仅为多对数阶,而以往方法在 $\kappa$ 上呈二次或五次方增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。