Skip to main content
QUICK REVIEW

[论文解读] Classification of Heavy-tailed Features in High Dimensions: a Superstatistical Approach

Urte Adomaityte, Gabriele Sicuro|arXiv (Cornell University)|Apr 6, 2023
Statistical Methods and Inference被引用 4
一句话总结

该论文提出了一种超统计框架,用于分析高维设置下具有重尾特征的二分类问题,将数据建模为随机方差从标量分布 $\varrho$ 中抽取的高斯分布的混合。利用复制方法,推导出泛化误差和训练误差的精确渐近表达式,揭示了在所有重尾分布下训练损失是普遍的,且与 $\varrho$ 无关,验证了该参数范围内‘高斯普遍性’的存在。

ABSTRACT

We characterise the learning of a mixture of two clouds of data points with generic centroids via empirical risk minimisation in the high dimensional regime, under the assumptions of generic convex loss and convex regularisation. Each cloud of data points is obtained via a double-stochastic process, where the sample is obtained from a Gaussian distribution whose variance is itself a random parameter sampled from a scalar distribution $\varrho$. As a result, our analysis covers a large family of data distributions, including the case of power-law-tailed distributions with no covariance, and allows us to test recent "Gaussian universality" claims. We study the generalisation performance of the obtained estimator, we analyse the role of regularisation, and we analytically characterise the separability transition.

研究动机与目标

  • 分析高维二分类中带有重尾特征的期望风险最小化的一般化性能。
  • 研究在非高斯、幂律尾部数据分布下凸正则化的作用。
  • 检验在非高斯协变量下‘高斯普遍性’声明在分类任务中的有效性。
  • 表征高维设置下具有重尾数据的可分性相变。
  • 将现有的高维渐近分析扩展至无限方差的分布,超越高斯假设。

提出的方法

  • 将每类数据建模为双重随机过程:从 $\mathcal{N}(\bm{\mu}, \Delta \mathbf{I}_d)$ 中抽取样本,其中 $\Delta$ 是具有分布 $\varrho$ 的随机变量。
  • 应用复制方法,在 $n,d \to \infty$ 且 $n/d = \alpha$ 固定的极限下,推导出测试误差和训练误差的精确渐近表达式。
  • 推导出有序参数 $v, q, \hat{v}, \hat{q}$ 的固定点方程,涉及在 $\varrho$ 下对 $\Delta$ 的期望,例如 $\delta_k = \mathbb{E}[(1 + v\Delta)^{-k}]$。
  • 使用状态演化和斯坦引理来稳定数值计算,特别是通过损失函数的二阶导数重写 $\hat{v}$ 的更新,以处理逻辑损失。
  • 使用摩尔-彭罗斯伪逆(二次损失)和 Scikit-learn 的 LogisticRegression(逻辑损失)进行数值实验,验证理论预测。
  • 在不同 $\varrho$(如逆伽马分布)下比较结果,以测试普遍性,特别是在 $\lambda \to 0$ 极限下。

实验结果

研究问题

  • RQ1在具有无限方差的重尾数据分布下,高维二分类中的训练误差是否在所有重尾分布下保持普遍?
  • RQ2当数据特征为重尾且非高斯时,凸正则化如何影响泛化性能?
  • RQ3对于具有任意质心分离的两个重尾数据簇的混合,其泛化误差的精确渐近行为是什么?
  • RQ4在非高斯、超统计数据模型下,高维分类中的可分性相变是否可以被解析表征?
  • RQ5当基础数据分布具有幂律尾部且二阶矩不存在时,‘高斯普遍性’的声明在多大程度上成立?

主要发现

  • 在 $\lambda \to 0$ 的极限下,训练损失收敛到与 $\varrho$ 无关的普遍公式 $\epsilon_\ell = \frac{1}{2}(1 - 1/\alpha)_+$。
  • 泛化误差 $\epsilon_g$ 显式依赖于 $\varrho$,通过 $\delta_1 = \mathbb{E}[(1 + v\Delta)^{-1}]$ 表达,表明测试性能不具有普遍性。
  • 对于带岭正则化的二次损失,测试损失通过涉及 $\delta_1$ 和 $\delta_2$ 的固定点方程被解析表征,这些量依赖于 $\varrho$。
  • 数值实验表明,理论预测与模拟结果在不同幂律衰减参数 $a$ 下高度一致,验证了分析框架的有效性。
  • 当 $a = 1/2$(即方差无穷大)时,泛化误差发散,与理论预期一致。
  • 该研究证实,在高维极限下,即使数据具有重尾,训练误差仍保持普遍性,支持了训练阶段中高斯普遍性的稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。