Skip to main content
QUICK REVIEW

[论文解读] List-Decodable Linear Regression

Sushrut Karmalkar, Adam R. Klivans|arXiv (Cornell University)|May 14, 2019
Machine Learning and Algorithms参考文献 23被引用 4
一句话总结

本文提出了首个针对列表可解线性回归的多项式时间算法,其中超过一半的数据点受到对抗性污染。该算法基于矩量平方(sum-of-squares)框架,输出一个常数大小的假设列表,其中至少有一个假设接近真实回归向量,前提是内点遵循可证明的反集中分布(如标准高斯分布或超立方体上的均匀分布),从而为这一鲁棒学习设置提供了首个具有强理论保证的高效解决方案。

ABSTRACT

We give the first polynomial-time algorithm for robust regression in the list-decodable setting where an adversary can corrupt a greater than $1/2$ fraction of examples. For any $α< 1$, our algorithm takes as input a sample $\{(x_i,y_i)\}_{i \leq n}$ of $n$ linear equations where $αn$ of the equations satisfy $y_i = \langle x_i,\ell^* angle +ζ$ for some small noise $ζ$ and $(1-α)n$ of the equations are {\em arbitrarily} chosen. It outputs a list $L$ of size $O(1/α)$ - a fixed constant - that contains an $\ell$ that is close to $\ell^*$. Our algorithm succeeds whenever the inliers are chosen from a \emph{certifiably} anti-concentrated distribution $D$. In particular, this gives a $(d/α)^{O(1/α^8)}$ time algorithm to find a $O(1/α)$ size list when the inlier distribution is standard Gaussian. For discrete product distributions that are anti-concentrated only in \emph{regular} directions, we give an algorithm that achieves similar guarantee under the promise that $\ell^*$ has all coordinates of the same magnitude. To complement our result, we prove that the anti-concentration assumption on the inliers is information-theoretically necessary. Our algorithm is based on a new framework for list-decodable learning that strengthens the `identifiability to algorithms' paradigm based on the sum-of-squares method. In an independent and concurrent work, Raghavendra and Yau also used the Sum-of-Squares method to give a similar result for list-decodable regression.

研究动机与目标

  • 设计一种在训练数据中超过一半被敌手污染时仍高效的多项式时间线性回归算法。
  • 识别使列表可解回归在信息论上可行的内点分布的最小假设。
  • 通过矩量平方方法,建立可证明反集中性质与鲁棒估计中算法可解性之间的系统性联系。
  • 提供一个紧致的信息论下界,证明反集中性质对任何列表可解回归算法都是必要的。

提出的方法

  • 该算法利用矩量平方(SoS)方法,构建一个候选回归向量上的伪分布,使其满足从污染数据中导出的矩量约束。
  • 采用一种新框架,通过引入内点分布的可证明反集中性质,强化了‘可识别性到算法’范式。
  • 对于具有次指数尾部的高斯分布和球对称分布,该算法实现运行时间 (d/α)^O(1/α⁸),并输出大小为 O(1/α) 的列表。
  • 对于离散乘积分布,该算法要求真实回归向量的坐标具有相等的模长,但在相同的反集中条件下,仍能实现相同的列表大小和运行时间。
  • 该方法构造了一组统计上不可区分于不同内点方向的分布族 R_i,从而实现了对列表大小的紧致下界。
  • 通过构造一个内点分布为 {0,1}^d 或 [q]^d 上均匀分布的分布族,证明了反集中性质在信息论上是必要的,即任何算法都无法在列表大小小于 d 的情况下成功。

实验结果

研究问题

  • RQ1我们能否在不依赖真实回归向量的强分离性或条件数假设的前提下,设计一种在超过一半数据被敌手污染时仍为多项式时间的线性回归算法?
  • RQ2使列表可解回归在信息论上可解的内点数据分布假设,其必要性和充分性条件是什么?
  • RQ3矩量平方方法能否被扩展,以在对内点分布假设较弱的条件下,为列表可解回归提供高效算法?
  • RQ4内点分布的反集中性质是否对高效列表可解回归而言既是必要也是充分的?
  • RQ5任何算法解决列表可解回归所需的最小列表大小是多少?在自然分布下,这一大小能否被紧致界定?

主要发现

  • 该算法运行时间为 (d/α)^O(1/α⁸),输出大小为 O(1/α) 的列表,当内点来自可证明反集中分布时,其中包含一个与真实向量 ℓ* 接近的回归向量。
  • 对于标准高斯内点,该算法实现运行时间 (d/α)^O(1/α⁸),并保证常数大小的列表,成为该设置下的首个高效解决方案。
  • 该算法在内点分布为可证明反集中时能够成功,这包括具有次指数尾部的球对称分布,以及具有规则反集中的离散乘积分布。
  • 本文证明了反集中性质在信息论上是必要的:对于 {0,1}^d 或 [q]^d 上的均匀分布,任何算法都无法在列表大小小于 d 的情况下成功,即使在无噪声条件下亦然。
  • 下界构造表明,对于任意 q,[q]^d 上的均匀分布满足 P(⟨x,v⟩=0) ≤ 1/q,且该界是紧致的,意味着当 q 较小时,列表大小必须随 d 增大而增长。
  • 本工作表明,仅当内点避免集中在低维子空间时,列表可解回归才可能实现;而可证明反集中性质为算法应用提供了可计算的条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。