[论文解读] Optimal learning of high-dimensional classification problems using deep neural networks
本文建立了使用深度神经网络进行高维二分类学习的极小极大最优学习速率,表明当决策边界为Barron正则时,泛化误差的衰减速率与输入维度无关。作者推导了Barron类的精确熵界,并证明在深度ReLU网络上进行经验风险最小化可实现最优速率,从而在决策边界具有正则性假设下有效克服了维度灾难。
We study the problem of learning classification functions from noiseless training samples, under the assumption that the decision boundary is of a certain regularity. We establish universal lower bounds for this estimation problem, for general classes of continuous decision boundaries. For the class of locally Barron-regular decision boundaries, we find that the optimal estimation rates are essentially independent of the underlying dimension and can be realized by empirical risk minimization methods over a suitable class of deep neural networks. These results are based on novel estimates of the $L^1$ and $L^\infty$ entropies of the class of Barron-regular functions.
研究动机与目标
- 建立在高维空间中学习具有平滑决策边界的分类函数的极小极大下界。
- 刻画当决策边界在局部为Barron正则时,分类问题的最优泛化误差速率。
- 弥合对深度神经网络是否能为这类问题实现最优速率的理解差距。
- 推导Barron类的$L^1$与$L^\infty$度量熵的精确估计,这对泛化界至关重要。
- 证明在深度ReLU网络上进行经验风险最小化可实现最优速率,且该速率与环境维度无关。
提出的方法
- 作者将分类估计问题转化为密度估计框架,以利用Yang和Barron已知的极小极大界。
- 基于决策边界类的$L^1$度量熵,推导出一般性的极小极大下界,表明速率取决于熵的标度$\varepsilon^{-1/\alpha}$。
- 本文建立了Barron类的$L^\infty$与$L^1$熵数的新型、精确的上下界,二者仅相差对数因子。
- 利用这些熵估计,作者证明Barron正则决策边界的最优学习速率为$m^{-\alpha/(\alpha+1)}$,且该速率与维度无关。
- 该方法采用在深度ReLU网络上进行经验风险最小化,并证明所得估计器达到了推导出的极小极大下界。
- 分析依赖于经验过程理论的高级工具,包括括号熵和覆盖数,并将[24]的结果适配到分类设置中。
实验结果
研究问题
- RQ1学习具有平滑决策边界的高维分类函数的根本极小极大下界是什么?
- RQ2深度神经网络能否为具有局部Barron正则决策边界的分类问题实现最优泛化速率?
- RQ3Barron类的度量熵在$L^1$与$L^\infty$范数下的标度如何?这对学习速率有何含义?
- RQ4在决策边界具有正则性假设下,泛化误差速率在多大程度上与输入维度$d$无关?
- RQ5在无噪声设置下,对深度ReLU网络进行经验风险最小化是否足以实现最优速率?
主要发现
- 对于决策边界属于$L^1$度量熵标度为$\varepsilon^{-1/\alpha}$的类,$L^2$-误差的极小极大下界为$m^{-\alpha/(\alpha+1)}$,且该界是紧的。
- 对于局部Barron正则决策边界的类,最优学习速率为$m^{-\alpha/(\alpha+1)}$,且该速率与环境维度$d$无关。
- $L^1$度量熵在$\varepsilon^{-1/\alpha}$量级内(相差对数因子),$L^\infty$熵的标度类似,上下界仅相差$\log$项。
- 在深度ReLU网络上进行经验风险最小化可实现Barron正则函数的最优速率$m^{-\alpha/(\alpha+1)}$,证明了深度网络在此设置下为极小极大最优。
- 结果表明,当决策边界具有足够正则性(具体为Barron正则性)时,维度灾难可被克服。
- 分析证实,在无噪声设置下,当决策边界在Barron意义下平滑时,泛化误差可比$m^{-1/2}$衰减得更快,即使在高维情形下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。