Skip to main content
QUICK REVIEW

[论文解读] A Polynomial Time Algorithm for Lossy Population Recovery

Ankur Moitra, Michael Saks|arXiv (Cornell University)|Feb 6, 2013
Machine Learning and Algorithms参考文献 20被引用 7
一句话总结

本文提出了一种多项式时间算法用于有损群体恢复,其中二进制字符串以独立同分布的方式以速率 $1 - \mu$ 被擦除。通过利用线性规划对偶性与复分析,作者证明了即使在条件数指数级小时,一个关键矩阵仍存在鲁棒的局部逆,从而实现了对任意未知的 $n$-比特字符串分布以 $\varepsilon$-精度进行高效学习,时间复杂度在 $n$ 和 $1/\varepsilon$ 上为多项式,且对任意固定的 $\mu > 0$ 成立。该结果首次为限制访问模型下的 DNF 学习提供了多项式时间算法。

ABSTRACT

We give a polynomial time algorithm for the lossy population recovery problem. In this problem, the goal is to approximately learn an unknown distribution on binary strings of length $n$ from lossy samples: for some parameter $μ$ each coordinate of the sample is preserved with probability $μ$ and otherwise is replaced by a `?'. The running time and number of samples needed for our algorithm is polynomial in $n$ and $1/\varepsilon$ for each fixed $μ>0$. This improves on algorithm of Wigderson and Yehudayoff that runs in quasi-polynomial time for any $μ> 0$ and the polynomial time algorithm of Dvir et al which was shown to work for $μ\gtrapprox 0.30$ by Batman et al. In fact, our algorithm also works in the more general framework of Batman et al. in which there is no a priori bound on the size of the support of the distribution. The algorithm we analyze is implicit in previous work; our main contribution is to analyze the algorithm by showing (via linear programming duality and connections to complex analysis) that a certain matrix associated with the problem has a robust local inverse even though its condition number is exponentially small. A corollary of our result is the first polynomial time algorithm for learning DNFs in the restriction access model of Dvir et al.

研究动机与目标

  • 为任意固定的 $\mu > 0$,在每个位以概率 $1 - \mu$ 独立擦除的情况下,开发一种有损群体恢复的多项式时间算法。
  • 克服先前准多项式时间方法中对支持大小 $k$ 的指数依赖。
  • 利用复分析工具,证明一个条件数指数级小的矩阵存在鲁棒局部逆。
  • 将算法推广至未知分布支持大小无先验界的一般情况。
  • 为 Dvir 等人提出的限制访问模型中 DNF 学习提供首个多项式时间解法。

提出的方法

  • 该算法使用线性规划从有损样本中估计未知分布,其中每个位以概率 $1 - \mu$ 被替换为 '?'。
  • 核心技术贡献在于证明了与采样过程相关的某一矩阵即使在条件数指数级小时,仍具有鲁棒局部逆。
  • 该证明依赖于复分析,特别是应用哈达玛三圆定理与莫比乌斯变换来分析复单位圆盘上全纯函数的行为。
  • 建立了一个关键的不确定性原理:若一个全纯函数在以 $1 - \mu$ 为中心的圆盘 $D_\rho(\beta)$ 上有界,则其在原点的值控制其在单位圆周上的最大值,并给出一个定量下界。
  • 分析利用了原始问题(分布估计)与对偶问题(多项式松弛)之间的对偶性,表明对偶目标函数可由逆条件数有界。
  • 通过避免在运行时间中依赖 $k$,该方法可推广至分布支持大小无界的场景。

实验结果

研究问题

  • RQ1对于任意固定的 $\mu > 0$,是否可以在不需 $\mu$ 远离零的条件下,实现有损群体恢复的多项式时间求解?
  • RQ2当矩阵的条件数指数级小时,其采样矩阵是否仍存在鲁棒局部逆?
  • RQ3用于擦除信道的技术是否可推广至更一般的噪声群体恢复模型,其中位被翻转而非擦除?
  • RQ4是否可能在限制访问模型中实现 DNF 学习的多项式时间求解,而该问题可归约为有损群体恢复?
  • RQ5复分析在验证统计估计中因数据丢失而产生的矩阵可逆性方面起到何种作用?

主要发现

  • 该算法运行时间为 $O((n/\varepsilon)^{2f(\mu)})$,其中 $f(\mu) = \frac{1}{\mu \log(2/\mu)} + O(1)$,对任意固定的 $\mu > 0$,在 $n$ 和 $1/\varepsilon$ 上为多项式时间。
  • 通过复分析中的不确定性原理证明了鲁棒局部逆的存在性,表明若一个全纯函数在以 $1 - \mu$ 为中心的圆盘上有界,则其在原点的值大时,其在单位圆周上的最大值也必须大。
  • 该方法即使在分布支持大小无界时仍有效,而先前的准多项式算法依赖于 $k$。
  • 该算法实现了对分布的 $\varepsilon$-精度估计,所有字符串上的误差不超过 $\varepsilon$,且对支持集中字符串的估计值与真实概率的偏差不超过 $\varepsilon$。
  • 该结果意味着首次为限制访问模型下的 DNF 学习提供了多项式时间算法,其中每个样本是输入变量的随机限制。
  • 分析表明,使用复单位圆盘 $D_1$ 上的 $L^\infty$-范数进行对偶松弛,可对原始目标函数给出紧的界,从而实现多项式时间复杂度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。