Skip to main content
QUICK REVIEW

[论文解读] Towards Resolving the Implicit Bias of Gradient Descent for Matrix Factorization: Greedy Low-Rank Learning

Zhiyuan Li, Yuping Luo|arXiv (Cornell University)|Dec 17, 2020
Face and Expression Recognition参考文献 40被引用 13
一句话总结

本文提出,在极小初始化下,二层矩阵分解中的梯度流在数学上等价于一种称为贪婪低秩学习(Greedy Low-Rank Learning, GLRL)的贪心秩最小化算法,相较于核范数最小化,提供了对梯度下降隐式偏差更丰富的表征。此外,研究进一步表明,更深的网络(深度 ≥ 3)增强了这种秩最小化行为,使其在实际初始化尺度下依然有效,并提出了反例以反驳梯度流最小化核范数的猜想。

ABSTRACT

Matrix factorization is a simple and natural test-bed to investigate the implicit regularization of gradient descent. Gunasekar et al. (2017) conjectured that Gradient Flow with infinitesimal initialization converges to the solution that minimizes the nuclear norm, but a series of recent papers argued that the language of norm minimization is not sufficient to give a full characterization for the implicit regularization. In this work, we provide theoretical and empirical evidence that for depth-2 matrix factorization, gradient flow with infinitesimal initialization is mathematically equivalent to a simple heuristic rank minimization algorithm, Greedy Low-Rank Learning, under some reasonable assumptions. This generalizes the rank minimization view from previous works to a much broader setting and enables us to construct counter-examples to refute the conjecture from Gunasekar et al. (2017). We also extend the results to the case where depth $\ge 3$, and we show that the benefit of being deeper is that the above convergence has a much weaker dependence over initialization magnitude so that this rank minimization is more likely to take effect for initialization with practical scale.

研究动机与目标

  • 为解决梯度下降在矩阵分解中的隐式偏差问题,特别是在深度神经网络背景下的问题。
  • 通过构造反例,挑战梯度流最小化核范数的猜想。
  • 提出并分析一种基于贪婪低秩学习(GLRL)的新隐式正则化表征。
  • 将分析扩展至深度矩阵分解(深度 ≥ 3),并表明深度可降低对初始化幅度的依赖性。
  • 通过实证实验验证理论发现。

提出的方法

  • 提出贪婪低秩学习(GLRL)算法,一种启发式算法,通过逐步增加秩约束直至收敛。
  • 在一定假设下,建立极小初始化下梯度流与GLRL之间的数学等价性。
  • 使用李雅普诺夫风格分析和微分不等式技术,对优化轨迹的演化进行有界分析。
  • 应用扰动分析,表明在训练初期,梯度流的轨迹与GLRL路径高度接近。
  • 引入时间依赖的范数分解方法,将权重矩阵的低秩与高秩分量分离。
  • 采用包含恒等初始化和深度相关缩放的参数化方法,分析深度矩阵分解。

实验结果

研究问题

  • RQ1矩阵分解中的梯度流是否等价于秩最小化过程?
  • RQ2梯度下降的隐式偏差能否通过秩最小化而非范数最小化得到更优表征?
  • RQ3深度如何影响秩最小化对初始化幅度的鲁棒性?
  • RQ4能否构造反例以反驳核范数最小化猜想?
  • RQ5GLRL框架是否可推广至此前研究的特殊情形之外?

主要发现

  • 在二层矩阵分解中,极小初始化下的梯度流在数学上等价于贪婪低秩学习(GLRL)这一贪心秩最小化算法。
  • 本文构造了一个反例,反驳了Gunasekar等人(2017)提出的梯度流最小化核范数的猜想。
  • 对于深度 ≥ 3 的情况,梯度流的隐式偏差对初始化幅度的依赖性显著减弱,使得在实际初始化尺度下更可能实现秩最小化。
  • 理论分析表明,即使在有限初始化条件下,梯度流轨迹在训练初期也会收敛至深度版本的GLRL。
  • 附录C的实证验证结果确认了理论预测的等价性以及秩最小化行为。
  • GLRL框架相较于基于范数的语言,能更丰富地表征隐式正则化,尤其在捕捉非均匀奇异值动态方面具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。