[论文解读] An optimal unrestricted learning procedure
本文提出了一种最优的无限制学习方法,可在任意函数类、分布和目标下实现最佳可能的样本复杂度,即使在重尾分布设置下亦成立。该方法通过允许从给定类之外选择函数,超越了传统合理学习的性能,且当函数类为凸集时,其退化为合理学习方法,从而在两种情形下均达到极小极大最优率。
We study learning problems involving arbitrary classes of functions $F$, distributions $X$ and targets $Y$. Because proper learning procedures, i.e., procedures that are only allowed to select functions in $F$, tend to perform poorly unless the problem satisfies some additional structural property (e.g., that $F$ is convex), we consider unrestricted learning procedures that are free to choose functions outside the given class. We present a new unrestricted procedure that is optimal in a very strong sense: the required sample complexity is essentially the best one can hope for, and the estimate holds for (almost) any problem, including heavy-tailed situations. Moreover, the sample complexity coincides with the what one would expect if $F$ were convex, even when $F$ is not. And if $F$ is convex, the procedure turns out to be proper. Thus, the unrestricted procedure is actually optimal in both realms, for convex classes as a proper procedure and for arbitrary classes as an unrestricted procedure.
研究动机与目标
- 为解决合理学习方法的局限性,后者在缺乏函数类凸性等结构假设时表现欠佳。
- 开发一种在任意函数类、分布和目标下样本复杂度最优的学习方法,包括非凸和重尾设置。
- 通过使用可选择给定类之外函数的无限制方法,统一凸类与非凸类下的最优性能。
- 建立一个样本复杂度上界,使其与任意学习问题的理论下界一致,仅相差一个绝对常数。
- 证明当函数类为凸集时,该方法退化为合理学习方法,从而在两种情形下均实现最优。
提出的方法
- 提出一种无限制学习方法,不严格受限于从给定类 $ F $ 中选择函数,从而在非凸设置下实现更优泛化。
- 将过剩风险分解为三部分:乘子过程 $ b{M} $、随机过程 $ b{Q} $ 和定位分量 $ b{P} $,并采用统一控制框架对每一部分进行分析。
- 基于 $ (r, u) $-本质子集的概念,使用几何论证控制过剩风险在最优函数 $ f^* $ 附近的定位。
- 应用类似链式结构的熵积分界,控制局部类 $ H_{f^*, r} $ 上的 Rademacher 二阶混沌过程的上确界,确保一致集中性。
- 对样本大小 $ N $ 施加一组条件,以确保三部分 $ b{P}, b{Q}, b{M} $ 以高概率 $ 1 - heta $ 满足概率界,从而实现高概率的过剩风险控制。
- 通过校准常数 $ u, heta_0, heta_1, heta_2, heta_3, heta_4 $ 得到显式样本复杂度界,这些常数基于类的几何与统计复杂度确定,其中 $ u riangleq 1/ ilde{ heta}_1^2 $,并将其与熵和 Rademacher 复杂度关联。
实验结果
研究问题
- RQ1是否存在一种学习方法,可在任意函数类 $ F $ 下实现最优样本复杂度,即使 $ F $ 为非凸或数据分布为重尾?
- RQ2为确保过剩风险 $ b{E}[ ext{excess risk}] riangleq b{E}[( ilde{f}(X) - Y)^2] - b{E}[(f^*(X) - Y)^2] riangleq b{E}_p riangleq b{E}[ ext{excess risk}] $ 以高概率 $ 1 - ilde{ heta}_2 $ 被 $ ilde{ heta}_1 $ 限制,所需的最小样本量是多少?
- RQ3如何设计一种学习方法,使其在凸类情况下(作为合理方法)和一般情况下(作为无限制方法)均表现最优?
- RQ4几何障碍(如非凸性)在决定无限制学习必要性方面起什么作用?如何通过样本复杂度控制加以克服?
- RQ5在多大程度上可使学习的样本复杂度独立于 $ F $ 的结构特性而被界定?所能达到的最紧界是什么?
主要发现
- 所提出的无限制学习方法在样本复杂度上达到最优,仅相差一个绝对常数,与任意涉及 $ (F, X, Y) $ 的学习问题的理论下界一致,即使 $ F $ 为非凸类亦成立。
- 该方法的样本复杂度与 $ F $ 为凸集时的预期一致,即使 $ F $ 实际并非凸集,表明无限制方法消除了对结构假设的需求。
- 当 $ F $ 为凸集时,该方法退化为合理学习方法,并在凸类中实现极小极大最优率,因此在两种情形下均达到最优。
- 该方法通过仅依赖于局部类 $ H_{f^*, r} $ 的熵、Rademacher 复杂度和目标 $ Y $ 的方差的样本大小 $ N $,以高概率 $ 1 - ilde{ heta}_2 $ 控制过剩风险。
- 分析表明,所需样本大小 $ N $ 满足 $ b{E}[ ext{supremum of Rademacher process}] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] $,确保一致集中性。
- 通过将过剩风险分解为三部分 $ b{P}, b{Q}, b{M} $,并在单一统一的样本复杂度条件下以高概率控制每一部分,证明了该方法的最优性,最终得到过剩风险上界 $ b{E}_p riangleq b{E}[ ext{excess risk}] riangleq b{E}[ ext{excess risk}] riangleq b{E}[ ext{excess risk}] $,其中 $ r' riangleq ilde{ heta}_1 r $,且 $ r riangleq ilde{ heta}_2 / ilde{ heta}_3^2 $,其中 $ ilde{ heta}_1 riangleq ilde{ heta}_1 $,$ ilde{ heta}_2 riangleq ilde{ heta}_2 $,$ ilde{ heta}_3 riangleq ilde{ heta}_3 $,$ ilde{ heta}_4 riangleq ilde{ heta}_4 $,$ ilde{ heta}_5 riangleq ilde{ heta}_5 $,$ ilde{ heta}_6 riangleq ilde{ heta}_6 $。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。