Skip to main content
QUICK REVIEW

[论文解读] On the Fine-Grained Complexity of Empirical Risk Minimization: Kernel Methods and Neural Networks

Artūrs Bačkurs, Piotr Indyk|arXiv (Cornell University)|Apr 10, 2017
Machine Learning and Algorithms被引用 14
一句话总结

本文利用细粒度复杂性理论,为核方法和神经网络中的经验风险最小化(ERM)建立了条件下界。在强指数时间假设(SETH)下,证明了不存在任何算法能在亚二次时间内以高精度求解核SVM、核岭回归或训练神经网络的最终层,且此类模型中的梯度计算也无法显著加速至O(n·m)时间以下。

ABSTRACT

Empirical risk minimization (ERM) is ubiquitous in machine learning and underlies most supervised learning methods. While there has been a large body of work on algorithms for various ERM problems, the exact computational complexity of ERM is still not understood. We address this issue for multiple popular ERM problems including kernel SVMs, kernel ridge regression, and training the final layer of a neural network. In particular, we give conditional hardness results for these problems based on complexity-theoretic assumptions such as the Strong Exponential Time Hypothesis. Under these assumptions, we show that there are no algorithms that solve the aforementioned ERM problems to high accuracy in sub-quadratic time. We also give similar hardness results for computing the gradient of the empirical loss, which is the main computational burden in many non-convex learning tasks.

研究动机与目标

  • 理解核方法和神经网络中经验风险最小化(ERM)的精确计算复杂度。
  • 确定在如核SVM和核岭回归等流行模型中,高精度ERM解是否可在亚二次时间内求解。
  • 在细粒度复杂性假设下,研究计算神经网络梯度(尤其是最终层)的复杂度。
  • 基于强指数时间假设(SETH)提供条件下的下界,SETH是细粒度复杂性中的标准假设。
  • 通过证明除非广泛接受的复杂性假设失效,否则优于二次性能的情况极不可能,从而弥合多项式时间算法与现有方法实际低效之间的差距。

提出的方法

  • 使用细粒度复杂性理论,特别是强指数时间假设(SETH),推导ERM和梯度计算的条件下的下界。
  • 通过在输入空间中精心构造的二值向量嵌入,将可满足性问题(CNF-SAT)归约到核方法和神经网络中的ERM问题。
  • 构建具有特定性质的损失函数:凸性、有界性,且在零处有唯一最小值,以保持底层计算问题的结构。
  • 采用一种矩阵构造,使得输入空间中正交的向量对对应较大的损失值,而非正交对则产生较小的损失,从而实现从CNF-SAT到ERM的归约。
  • 分析对偶变量α的不同赋值下经验风险的行为,表明最优解对应于正交对的存在。
  • 证明任何以高精度求解ERM问题的算法,本质上必须求解底层的CNF-SAT实例,这意味着亚二次时间算法将违反SETH。

实验结果

研究问题

  • RQ1在标准复杂性假设下,核SVM能否在亚二次时间内以高精度求解?
  • RQ2是否存在比O(n·m)更快的算法来计算神经网络最终层的经验损失梯度?
  • RQ3假设SETH成立,核岭回归能否比二次时间更高效地求解?
  • RQ4核方法和神经网络中ERM的计算复杂度是否因本质困难而呈二次方增长,还是仅因算法不够优化?
  • RQ5在深度学习模型中,是否存在加速梯度计算的根本限制,即无法显著快于独立处理每个样本?

主要发现

  • 在强指数时间假设(SETH)下,不存在能在亚二次时间内以高精度求解核SVM的算法。
  • 相同的困难结果也适用于核岭回归和训练神经网络的最终层,表明这些问题在样本数量上本质上是二次的。
  • 除非SETH不成立,否则无法在O(n·m)时间以下完成神经网络最终层经验损失梯度的计算,其中n为单元数,m为样本数。
  • 本文表明,在相同复杂性假设下,任何算法都无法显著快于独立处理每个样本的方式计算批量梯度。
  • 这些困难结果是条件性的,但基于细粒度复杂性中广泛接受的猜想(如SETH),这些猜想已历经数十年算法研究的检验。
  • 结果表明,高精度ERM和梯度计算在流行模型中的计算成本本质上受限于底层数据的结构,而不仅仅是算法效率低下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。