Skip to main content
QUICK REVIEW

[论文解读] Approximation Schemes for ReLU Regression

Ilias Diakonikolas, Surbhi Goel|arXiv (Cornell University)|May 26, 2020
Machine Learning and Algorithms参考文献 27被引用 8
一句话总结

本论文在弱分布假设(如各向同性对数凹或次高斯分布)下,首次提出了ReLU回归的高效常数因子近似算法。通过引入一种新型代理损失表征方式,利用分布特性诱导强凸性,作者实现了多项式时间近似方案(PTAS),其样本复杂度接近最优,误差界达到信息论极限。

ABSTRACT

We consider the fundamental problem of ReLU regression, where the goal is to output the best fitting ReLU with respect to square loss given access to draws from some unknown distribution. We give the first efficient, constant-factor approximation algorithm for this problem assuming the underlying distribution satisfies some weak concentration and anti-concentration conditions (and includes, for example, all log-concave distributions). This solves the main open problem of Goel et al., who proved hardness results for any exact algorithm for ReLU regression (up to an additive $ε$). Using more sophisticated techniques, we can improve our results and obtain a polynomial-time approximation scheme for any subgaussian distribution. Given the aforementioned hardness results, these guarantees can not be substantially improved. Our main insight is a new characterization of surrogate losses for nonconvex activations. While prior work had established the existence of convex surrogates for monotone activations, we show that properties of the underlying distribution actually induce strong convexity for the loss, allowing us to relate the global minimum to the activation's Chow parameters.

研究动机与目标

  • 解决ReLU回归在弱分布假设下是否可实现多项式时间内的常数因子近似这一开放问题。
  • 通过利用分布特异性性质,克服ReLU回归中的非凸性与指数级局部极小值数量,确保代理损失的强凸性。
  • 设计一种算法,在各向同性对数凹分布下实现误差在O(opt) + ε以内,在次高斯分布下实现(1+η)·opt + ε以内,与已知的难解下界一致。
  • 建立对数凹分布下信息论最优的样本复杂度Õ(d/ε²),在维度d上近乎线性。
  • 通过将全局最小值与在分布约束下激活特定的Chow参数关联,为非凸设置中的代理损失设计提供理论基础。

提出的方法

  • 提出一种新型代理损失表征方式,利用分布特性(如对数凹性、次高斯性)诱导强凸性,从而实现全局收敛保证。
  • 利用对数凹分布下经验过程的统一单侧集中性来界定估计误差,确保样本效率。
  • 应用先进的反集中与集中不等式,控制次高斯假设下ReLU损失的尾部行为。
  • 通过结合ReLU函数的多项式逼近与低次多项式上的经验风险最小化,构建多项式时间近似方案(PTAS)。
  • 利用代理损失全局最小值与ReLU激活Chow参数之间的联系,确保近似质量。
  • 采用两阶段方法:第一阶段,在有界噪声下使用类似序贯回归的技术近似条件均值函数;第二阶段,通过多项式逼近与经验风险最小化精炼估计。

实验结果

研究问题

  • RQ1在各向同性对数凹或次高斯分布下,是否可在多项式时间内实现ReLU回归的常数因子近似?
  • RQ2对数凹性或次高斯性等分布特性在多大程度上能为非凸ReLU回归中的代理损失诱导强凸性?
  • RQ3是否可设计一种样本复杂度在维度d上近乎线性,同时实现误差在O(opt) + ε以内的算法?
  • RQ4在更强的次高斯假设下,是否可将近似保证提升至(1+η)·opt + ε(对任意常数η > 0)?
  • RQ5在分布约束下,ReLU激活的Chow参数与代理损失全局最小值之间有何关系?

主要发现

  • 对于各向同性对数凹分布,该算法在Õ(d/ε²)个样本和Õ(d²/ε²)的时间内实现O(opt) + ε的误差,样本复杂度与信息论下限仅相差对数因子。
  • 在ν-次高斯分布下,实现了PTAS,样本与运行时间复杂度为O((1/ε²)·(d/(η³ν²))^(1/η³))(对任意常数η > 0),实现(1+η)·opt + ε的误差。
  • 该算法是首个在弱分布假设下,以多项式时间实现ReLU回归常数因子近似的算法。
  • 误差界本质上是紧的,因为已知难解结果表明:在一般分布下,无法实现优于O(opt) + ε的误差。
  • 分析表明,分布特性(如反集中性)可诱导代理损失的强凸性,从而在非凸性存在的情况下实现全局收敛。
  • 该方法建立了代理损失全局最小值与ReLU激活Chow参数之间全新的联系,从而为近似质量提供理论保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。