Skip to main content
QUICK REVIEW

[论文解读] How Hard Is Robust Mean Estimation?

Samuel B. Hopkins, Jerry Li|arXiv (Cornell University)|Mar 19, 2019
Machine Learning and Algorithms参考文献 29被引用 8
一句话总结

本文提供了复杂性理论证据,表明在自然分布假设下,改进当前多项式时间算法在鲁棒均值估计中的误差率在计算上是不可行的。通过从小集合扩张假设的变体进行归约,本文表明,若能实现更优的误差界(如亚√ε率),将导致小集合扩张假设被否定,这意味着在多项式时间范围内,现有算法在许多设定下本质上已是最优的。

ABSTRACT

Robust mean estimation is the problem of estimating the mean $μ\in \mathbb{R}^d$ of a $d$-dimensional distribution $D$ from a list of independent samples, an $ε$-fraction of which have been arbitrarily corrupted by a malicious adversary. Recent algorithmic progress has resulted in the first polynomial-time algorithms which achieve \emph{dimension-independent} rates of error: for instance, if $D$ has covariance $I$, in polynomial-time one may find $\hatμ$ with $\|μ- \hatμ\| \leq O(\sqrtε)$. However, error rates achieved by current polynomial-time algorithms, while dimension-independent, are sub-optimal in many natural settings, such as when $D$ is sub-Gaussian, or has bounded $4$-th moments. In this work we give worst-case complexity-theoretic evidence that improving on the error rates of current polynomial-time algorithms for robust mean estimation may be computationally intractable in natural settings. We show that several natural approaches to improving error rates of current polynomial-time robust mean estimation algorithms would imply efficient algorithms for the small-set expansion problem, refuting Raghavendra and Steurer's small-set expansion hypothesis (so long as $P eq NP$). We also give the first direct reduction to the robust mean estimation problem, starting from a plausible but nonstandard variant of the small-set expansion problem.

研究动机与目标

  • 调查当前多项式时间鲁棒均值估计算法是否实现了最优误差率。
  • 确定在次高斯或四阶矩有界分布假设下,改进误差率在计算上是否可行。
  • 建立鲁棒均值估计与小集合扩张假设(SSEH)之间的联系。
  • 提供复杂性理论证据,表明若P ≠ NP,则改进误差率将否定SSE假设。
  • 开发新的谱图理论工具,以加强从SSE到鲁棒估计问题的归约。

提出的方法

  • 使用谱图理论,将小集合扩张问题的变体归约为鲁棒均值估计。
  • 提出小集合扩张图谱嵌入中对小集合的新型刻画。
  • 重新解释并简化了使用谱方法证明2→q范数困难性的过程。
  • 采用随机游走舍入技术,在谱嵌入中识别出具有大均值偏移的小集合。
  • 利用矩条件与特征值界,将向量范数与均值估计误差关联起来。
  • 应用局部Cheeger不等式以验证扩张性质,并推导误差率的下界。

实验结果

研究问题

  • RQ1在次高斯或四阶矩有界假设下,多项式时间鲁棒均值估计算法能否实现优于O(√ε)的误差率?
  • RQ2是否存在计算障碍,阻止在鲁棒均值估计中对当前误差率进行改进?
  • RQ3小集合扩张假设在多大程度上暗示了鲁棒估计问题的困难性?
  • RQ4谱嵌入能否用于验证高维数据中的鲁棒性或矩有界性?
  • RQ5在分布约束下,2→q范数的困难性与鲁棒均值估计之间存在何种关系?

主要发现

  • 若将当前多项式时间鲁棒均值估计器的误差率改进至O(√ε)以下,将否定小集合扩张假设。
  • 任何在Steinhardt等人提出的鲁棒性假设下实现优于O(√ε)误差率的高效算法,都将否定小集合扩张假设的一个强化版本。
  • 本文首次实现了从小集合扩张问题的一个合理变体到鲁棒均值估计的直接归约。
  • 谱嵌入中对小集合的谱刻画,使得2→q范数困难性的证明得以简化并推广。
  • 分析表明,实现亚√ε误差率需要解决与小集合扩张等价难度的问题,而后者被认为难以求解。
  • 结果表明,当前多项式时间鲁棒均值估计算法在许多自然分布设定下,其误差率本质上已是最优的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。