Skip to main content
QUICK REVIEW

[论文解读] Generalization in Machine Learning via Analytical Learning Theory

Kenji Kawaguchi, Yoshua Bengio|arXiv (Cornell University)|Feb 21, 2018
Machine Learning and Algorithms参考文献 46被引用 14
一句话总结

本文提出解析学习理论,这是一种测度论框架,通过将数据集和模型视为固定、非随机的对象,无需统计假设即可分析机器学习中的泛化问题。该理论推导出一种新型正则化方法,在CIFAR-10、CIFAR-100和SVHN上表现优于先前方法,同时为零样本学习、表征学习和课程学习提供了理论依据。

ABSTRACT

This paper introduces a novel measure-theoretic theory for machine learning that does not require statistical assumptions. Based on this theory, a new regularization method in deep learning is derived and shown to outperform previous methods in CIFAR-10, CIFAR-100, and SVHN. Moreover, the proposed theory provides a theoretical basis for a family of practically successful regularization methods in deep learning. We discuss several consequences of our results on one-shot learning, representation learning, deep learning, and curriculum learning. Unlike statistical learning theory, the proposed learning theory analyzes each problem instance individually via measure theory, rather than a set of problem instances via statistics. As a result, it provides different types of results and insights when compared to statistical learning theory.

研究动机与目标

  • 开发一种不依赖统计假设或随机变量的泛化分析学习理论。
  • 利用测度论工具而非浓度不等式,为泛化差距提供实例特定的理论界。
  • 基于所提出的理论推导一种新的正则化方法,以改善深度学习中的泛化性能。
  • 在非统计框架下,为如零样本学习、表征学习和课程学习等既定实践提供理论解释。
  • 通过关注后验依赖界,以强实例依赖性方式,补充统计学习理论,聚焦于先验洞察。

提出的方法

  • 提出一种基于测度论的非统计学习理论,将真实数据测度、训练数据集和学习模型视为固定对象。
  • 将泛化差距定义为真实测度下的期望误差与训练集上的经验误差之差。
  • 引入差异性(discrepancy)和变差(variation,按Hardy与Krause意义)分别作为数据集质量与函数平滑度的度量。
  • 推导出一个泛化界,其依赖于训练数据集的差异性与损失函数的变差,且独立于假设空间的复杂度。
  • 基于推导出的界构建一种新正则化方法,通过惩罚训练数据上损失函数的高变差来实现。
  • 在CIFAR-10、CIFAR-100和SVHN上对正则化方法进行实证评估,并与现有方法进行性能比较。

实验结果

研究问题

  • RQ1机器学习中的泛化能否在不假设数据集或学习算法具有随机性的情况下进行分析?
  • RQ2基于测度论的理论如何提供比统计学习理论更强的、实例特定的泛化差距界?
  • RQ3数据集差异性与函数变差在决定泛化性能中起什么作用?
  • RQ4从该理论推导出的正则化方法能否在标准基准上超越现有方法?
  • RQ5所提出的框架是否为零样本学习与课程学习等实践提供了理论依据?

主要发现

  • 所提出的解析学习理论提供了对实例特定的泛化界,其对假设空间复杂度与学习算法均保持不变。
  • 所推导的正则化方法在CIFAR-10、CIFAR-100和SVHN上达到SOTA性能,优于先前方法。
  • 该理论解释了经验观察:即使在大容量模型和确定性训练数据下(如ImageNet与CIFAR-10)仍能实现良好泛化。
  • 该框架为零样本学习、表征学习与课程学习提供了理论依据,这些是测度论方法的自然结果。
  • 泛化界仅依赖于数据集差异性与函数变差,不依赖于统计属性如Rademacher复杂度或VC维。
  • 该方法的成功表明,非统计、实例依赖的分析可为深度学习带来实际且理论坚实的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。