[论文解读] A New Perspective on Machine Learning: How to do Perfect Supervised Learning
本文通过引入带限性(bandlimiting)——基于物理可实现性的原理——提出了一套新的监督机器学习理论框架,表明在足够多的数据和足够复杂的带限模型下,所有实际学习任务均可渐近可解。关键结果是:随着训练数据量的增加,泛化误差收敛于零,从而解决了大深度神经网络中避免过拟合的悖论。
In this work, we introduce the concept of bandlimiting into the theory of machine learning because all physical processes are bandlimited by nature, including real-world machine learning tasks. After the bandlimiting constraint is taken into account, our theoretical analysis has shown that all practical machine learning tasks are asymptotically solvable in a perfect sense. Furthermore, the key towards this solvability almost solely relies on two factors: i) a sufficiently large amount of training samples beyond a threshold determined by a difficulty measurement of the underlying task; ii) a sufficiently complex and bandlimited model. Moreover, for some special cases, we have derived new error bounds for perfect learning, which can quantify the difficulty of learning. These generalization bounds are not only asymptotically convergent but also irrelevant to model complexity. Our new results on generalization have provided a new perspective to explain the recent successes of large-scale supervised learning using complex models like neural networks.
研究动机与目标
- 为解决机器学习中的理论-实践鸿沟,特别是解释为何高容量的大规模神经网络仍能良好泛化。
- 形式化现实世界学习任务中带限性的物理约束,承认所有物理过程本质上都是带限的。
- 建立监督学习在极限情况下渐近完美的条件,且与模型复杂度无关。
- 推导出与模型复杂度无关的泛化误差界,以量化学习难度。
- 通过带限函数逼近和数据规模扩展的视角,解释深度学习的成功。
提出的方法
- 提出一种确定性函数拟合公式,假设目标函数 $ f(\boldsymbol{x}) $ 为带限函数,以反映物理可实现性。
- 应用具有正交单项式基的多元泰勒展开,以表示目标函数和学习到的模型 $ \hat{f}(\boldsymbol{x}) $,误差项受 $ \xi_n(\boldsymbol{x}) $ 限制。
- 利用从训练样本构建的多元范德蒙德矩阵求解模型系数,证明当样本独立同分布地来自 $ p(\boldsymbol{x}) $ 时,其可逆性概率为 1。
- 证明当 $ N \to \infty $ 时,真实系数与学习到的系数之差趋于零,残差误差 $ \boldsymbol{\xi}_N \to 0 $,从而确保 $ \hat{f} \to f $ 的收敛性。
- 通过引入一个微小的带外残差 $ \epsilon $,将证明扩展至近似带限函数,维持在 $ B_\epsilon $-带限条件下的收敛性。
- 证明在 $ N \to \infty $ 的极限下,任意两个学习模型 $ \hat{f}_1 $ 和 $ \hat{f}_2 $ 的差异趋于零,即 $ \|\hat{f}_1 - \hat{f}_2\| \to 0 $,在期望下成立。
实验结果
研究问题
- RQ1为何大规模神经网络在实践中能良好泛化,尽管理论预测其存在过拟合风险?
- RQ2在现实物理约束(如带限性)下,监督学习是否可渐近完美?
- RQ3实现完美学习的最小数据需求是多少?其与任务内在难度有何关联?
- RQ4如何推导出与模型复杂度无关的泛化误差界?
- RQ5带限模型与足够多的数据在多大程度上能确保收敛至真实函数?
主要发现
- 当目标函数与模型均为带限函数且训练数据足够充分时,所有实际机器学习任务均可渐近完美求解。
- 当 $ N \to \infty $ 时,期望泛化误差 $ R(\hat{f}|\mathcal{D}_N) \to 0 $,误差界以 $ \frac{(KB^\prime U)^{n+1}H}{(n+1)!} \to 0 $ 的速度衰减,且与模型复杂度无关。
- 所需训练样本数 $ N $ 的尺度为 $ O((N^{1/K})) $,其中 $ K $ 为输入维度,通过泰勒展开的阶数将数据规模与模型容量关联起来。
- 当样本独立同分布时,由训练样本构成的多元范德蒙德矩阵以概率 1 可逆,确保在极限下唯一解的恢复。
- 对于近似带限函数,通过用 $ \epsilon $-近似带限 $ B_\epsilon $ 替代真实带限 $ B $,收敛结果依然成立,且误差界保持不变。
- 在 $ N \to \infty $ 的极限下,任意两个学习模型 $ \hat{f}_1 $ 和 $ \hat{f}_2 $ 在 $ p(\boldsymbol{x}) $ 下的 $ L^2 $-范数下趋于一致,即 $ \|\hat{f}_1 - \hat{f}_2\| \to 0 $,证明了在渐近情形下模型的等价性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。