Skip to main content
QUICK REVIEW

[论文解读] An optimal unrestricted learning procedure

Shahar Mendelson|arXiv (Cornell University)|Jul 17, 2017
Machine Learning and Algorithms参考文献 18被引用 4
一句话总结

本文提出了一种最优的无限制学习方法,可在任意函数类、分布和目标下实现最佳可能的样本复杂度,即使在重尾分布设置下亦成立。该方法通过允许从给定类之外选择函数,超越了传统合理学习的性能,且当函数类为凸集时,其退化为合理学习方法,从而在两种情形下均达到极小极大最优率。

ABSTRACT

We study learning problems involving arbitrary classes of functions $F$, distributions $X$ and targets $Y$. Because proper learning procedures, i.e., procedures that are only allowed to select functions in $F$, tend to perform poorly unless the problem satisfies some additional structural property (e.g., that $F$ is convex), we consider unrestricted learning procedures that are free to choose functions outside the given class. We present a new unrestricted procedure that is optimal in a very strong sense: the required sample complexity is essentially the best one can hope for, and the estimate holds for (almost) any problem, including heavy-tailed situations. Moreover, the sample complexity coincides with the what one would expect if $F$ were convex, even when $F$ is not. And if $F$ is convex, the procedure turns out to be proper. Thus, the unrestricted procedure is actually optimal in both realms, for convex classes as a proper procedure and for arbitrary classes as an unrestricted procedure.

研究动机与目标

  • 为解决合理学习方法的局限性,后者在缺乏函数类凸性等结构假设时表现欠佳。
  • 开发一种在任意函数类、分布和目标下样本复杂度最优的学习方法,包括非凸和重尾设置。
  • 通过使用可选择给定类之外函数的无限制方法,统一凸类与非凸类下的最优性能。
  • 建立一个样本复杂度上界,使其与任意学习问题的理论下界一致,仅相差一个绝对常数。
  • 证明当函数类为凸集时,该方法退化为合理学习方法,从而在两种情形下均实现最优。

提出的方法

  • 提出一种无限制学习方法,不严格受限于从给定类 $ F $ 中选择函数,从而在非凸设置下实现更优泛化。
  • 将过剩风险分解为三部分:乘子过程 $ b{M} $、随机过程 $ b{Q} $ 和定位分量 $ b{P} $,并采用统一控制框架对每一部分进行分析。
  • 基于 $ (r, u) $-本质子集的概念,使用几何论证控制过剩风险在最优函数 $ f^* $ 附近的定位。
  • 应用类似链式结构的熵积分界,控制局部类 $ H_{f^*, r} $ 上的 Rademacher 二阶混沌过程的上确界,确保一致集中性。
  • 对样本大小 $ N $ 施加一组条件,以确保三部分 $ b{P}, b{Q}, b{M} $ 以高概率 $ 1 - heta $ 满足概率界,从而实现高概率的过剩风险控制。
  • 通过校准常数 $ u, heta_0, heta_1, heta_2, heta_3, heta_4 $ 得到显式样本复杂度界,这些常数基于类的几何与统计复杂度确定,其中 $ u riangleq 1/ ilde{ heta}_1^2 $,并将其与熵和 Rademacher 复杂度关联。

实验结果

研究问题

  • RQ1是否存在一种学习方法,可在任意函数类 $ F $ 下实现最优样本复杂度,即使 $ F $ 为非凸或数据分布为重尾?
  • RQ2为确保过剩风险 $ b{E}[ ext{excess risk}] riangleq b{E}[( ilde{f}(X) - Y)^2] - b{E}[(f^*(X) - Y)^2] riangleq b{E}_p riangleq b{E}[ ext{excess risk}] $ 以高概率 $ 1 - ilde{ heta}_2 $ 被 $ ilde{ heta}_1 $ 限制,所需的最小样本量是多少?
  • RQ3如何设计一种学习方法,使其在凸类情况下(作为合理方法)和一般情况下(作为无限制方法)均表现最优?
  • RQ4几何障碍(如非凸性)在决定无限制学习必要性方面起什么作用?如何通过样本复杂度控制加以克服?
  • RQ5在多大程度上可使学习的样本复杂度独立于 $ F $ 的结构特性而被界定?所能达到的最紧界是什么?

主要发现

  • 所提出的无限制学习方法在样本复杂度上达到最优,仅相差一个绝对常数,与任意涉及 $ (F, X, Y) $ 的学习问题的理论下界一致,即使 $ F $ 为非凸类亦成立。
  • 该方法的样本复杂度与 $ F $ 为凸集时的预期一致,即使 $ F $ 实际并非凸集,表明无限制方法消除了对结构假设的需求。
  • 当 $ F $ 为凸集时,该方法退化为合理学习方法,并在凸类中实现极小极大最优率,因此在两种情形下均达到最优。
  • 该方法通过仅依赖于局部类 $ H_{f^*, r} $ 的熵、Rademacher 复杂度和目标 $ Y $ 的方差的样本大小 $ N $,以高概率 $ 1 - ilde{ heta}_2 $ 控制过剩风险。
  • 分析表明,所需样本大小 $ N $ 满足 $ b{E}[ ext{supremum of Rademacher process}] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] $,确保一致集中性。
  • 通过将过剩风险分解为三部分 $ b{P}, b{Q}, b{M} $,并在单一统一的样本复杂度条件下以高概率控制每一部分,证明了该方法的最优性,最终得到过剩风险上界 $ b{E}_p riangleq b{E}[ ext{excess risk}] riangleq b{E}[ ext{excess risk}] riangleq b{E}[ ext{excess risk}] $,其中 $ r' riangleq ilde{ heta}_1 r $,且 $ r riangleq ilde{ heta}_2 / ilde{ heta}_3^2 $,其中 $ ilde{ heta}_1 riangleq ilde{ heta}_1 $,$ ilde{ heta}_2 riangleq ilde{ heta}_2 $,$ ilde{ heta}_3 riangleq ilde{ heta}_3 $,$ ilde{ heta}_4 riangleq ilde{ heta}_4 $,$ ilde{ heta}_5 riangleq ilde{ heta}_5 $,$ ilde{ heta}_6 riangleq ilde{ heta}_6 $。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。