Skip to main content
QUICK REVIEW

[论文解读] Agnostic Learning of Disjunctions on Symmetric Distributions

Vitaly Feldman, Pravesh K. Kothari|arXiv (Cornell University)|May 27, 2014
Machine Learning and Algorithms参考文献 25被引用 3
一句话总结

本论文提出了一种在 {0,1}^n 上对称分布下对析取式进行无监督学习的算法,通过使用一组结构化的基函数进行 ℓ₁-近似,实现了 n^{O(log(1/ε))} 的运行时间。它证明了低次多项式无法在所有对称分布上实现此类近似,建立了 1/3-近似所需的 Ω(√n) 次多项式次数下界,并为乘积分布提供了一种新的、更简洁的证明,表明 O(log(1/ε)) 次多项式足以实现 ε-近似。

ABSTRACT

We consider the problem of approximating and learning disjunctions (or equivalently, conjunctions) on symmetric distributions over $\{0,1\}^n$. Symmetric distributions are distributions whose PDF is invariant under any permutation of the variables. We give a simple proof that for every symmetric distribution $\mathcal{D}$, there exists a set of $n^{O(\log{(1/ε)})}$ functions $\mathcal{S}$, such that for every disjunction $c$, there is function $p$, expressible as a linear combination of functions in $\mathcal{S}$, such that $p$ $ε$-approximates $c$ in $\ell_1$ distance on $\mathcal{D}$ or $\mathbf{E}_{x \sim \mathcal{D}}[ |c(x)-p(x)|] \leq ε$. This directly gives an agnostic learning algorithm for disjunctions on symmetric distributions that runs in time $n^{O( \log{(1/ε)})}$. The best known previous bound is $n^{O(1/ε^4)}$ and follows from approximation of the more general class of halfspaces (Wimmer, 2010). We also show that there exists a symmetric distribution $\mathcal{D}$, such that the minimum degree of a polynomial that $1/3$-approximates the disjunction of all $n$ variables is $\ell_1$ distance on $\mathcal{D}$ is $Ω( \sqrt{n})$. Therefore the learning result above cannot be achieved via $\ell_1$-regression with a polynomial basis used in most other agnostic learning algorithms. Our technique also gives a simple proof that for any product distribution $\mathcal{D}$ and every disjunction $c$, there exists a polynomial $p$ of degree $O(\log{(1/ε)})$ such that $p$ $ε$-approximates $c$ in $\ell_1$ distance on $\mathcal{D}$. This was first proved by Blais et al. (2008) via a more involved argument.

研究动机与目标

  • 开发一种在对称分布下对析取式进行高效无监督学习的算法,该类分布是均匀分布的推广。
  • 克服低次多项式近似方法的局限性,因为其在某些对称分布上会失效。
  • 为对称分布下析取式的多项式近似建立紧致的次数下界。
  • 通过该框架为已知结果提供更简洁的证明:即 O(log(1/ε)) 次多项式足以在乘积分布上实现 ℓ₁-近似。
  • 将析取式的可学习性与带噪声稀疏奇偶校验学习的困难性联系起来,表明更快的算法将导致该问题的突破性进展。

提出的方法

  • 该方法依赖于构造一个大小为 n^{O(log(1/ε))} 的函数集合 S,使得在任意对称分布 D 上,任何析取式均可通过 S 中函数的线性组合以 ℓ₁ 范数近似。
  • 利用线性规划中的对偶性分析,研究次数为 r 的多项式所能达到的最小 ℓ₁ 误差,表明对偶解对应于一个分布,使得最佳拟合多项式的误差等于最优近似误差。
  • 对于乘积分布,该方法利用噪声敏感性分析以及高权重输入概率的界,证明 O(log(1/ε)) 次多项式足以实现 ε-近似。
  • Ω(√n) 下界证明通过构造一个特定的对称分布 D,使得所有 n 个变量的析取式无法被任何 o(√n) 次多项式在 ℓ₁ 距离上以小于 1/3 的误差近似。
  • 该方法应用 Kalai 等人(2008)提出的 ℓ₁-回归框架,利用构造的基函数,通过凸优化实现高效的无监督学习。
  • 将学习稀疏奇偶校验的问题转化为学习析取式,利用析取式与奇偶校验之间的相关性界,表明析取式的快速学习将意味着稀疏奇偶校验的快速学习。

实验结果

研究问题

  • RQ1能否在对称分布下以亚指数时间无监督学习析取式?若可,最优时间复杂度是多少?
  • RQ2为何标准的低次多项式基在所有对称分布上均无法近似析取式?实现常数误差近似的最小次数是多少?
  • RQ3能否通过该框架更简洁地证明乘积分布下的已知结果:即 O(log(1/ε)) 次多项式可在 ℓ₁ 范数下实现任意析取式的 ε-近似?
  • RQ4是否存在针对对称分布上析取式多项式近似的分布特异性次数下界?
  • RQ5在对称分布上析取式无监督学习算法的运行时间若快于 n^{O(log(1/ε))},是否意味着可为学习带噪声稀疏奇偶校验这一难题提供更快的算法?

主要发现

  • 本论文证明,在任意对称分布下,析取式的无监督学习可在 n^{O(log(1/ε))} 时间内实现,优于 Wimmer(2010)提出的 n^{O(1/ε⁴)} 上界。
  • 它证明了在特定对称分布上,任何 1/3-近似 x₁∨⋯∨xₙ 的多项式在 ℓ₁ 距离上的次数必须达到 Ω(√n) 的下界,表明低次多项式在一般情况下不足以实现近似。
  • 对于乘积分布,本文给出了一个新且更简洁的证明,表明 O(log(1/ε)) 次多项式足以在 ℓ₁ 距离上实现任意析取式的 ε-近似,其结果与 Blais 等人(2008)一致,但论证更为直接。
  • 通过大小为 n^{O(log(1/ε))} 的结构化基函数进行 ℓ₁-近似,可直接导出基于 ℓ₁-回归的无监督学习算法,其过剩误差不超过 ε。
  • 本文表明,若在均匀分布上存在运行时间快于 n^{o(log(1/ε))} 的析取式学习算法,将意味着可为学习 k-稀疏奇偶校验与噪声问题提供次指数时间算法,从而将两个问题联系起来。
  • 该归约表明,若将算法运行时间进一步优化至 n^{O(log(1/ε))} 以下,将为学习理论中一个著名的难题——学习带噪声的稀疏奇偶校验——提供更快的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。