Skip to main content
QUICK REVIEW

[论文解读] Minimizers of the Empirical Risk and Risk Monotonicity

Marco Loog, Tom J. Viering|arXiv (Cornell University)|Jul 11, 2019
Machine Learning and Data Classification参考文献 35被引用 7
一句话总结

本文引入了风险单调性的形式化概念,将其定义为:随着训练集增大,期望风险不应上升。研究表明,许多标准的经验风险最小化方法——涵盖分类、回归和密度估计——即使在任意大的样本量下,也可能表现出非单调的学习曲线,这挑战了人们普遍认为更多数据在期望上总能提升性能的假设。

ABSTRACT

Plotting a learner's average performance against the number of training samples results in a learning curve. Studying such curves on one or more data sets is a way to get to a better understanding of the generalization properties of this learner. The behavior of learning curves is, however, not very well understood and can display (for most researchers) quite unexpected behavior. Our work introduces the formal notion of \emph{risk monotonicity}, which asks the risk to not deteriorate with increasing training set sizes in expectation over the training samples. We then present the surprising result that various standard learners, specifically those that minimize the empirical risk, can act \emph{non}monotonically irrespective of the training sample size. We provide a theoretical underpinning for specific instantiations from classification, regression, and density estimation. Altogether, the proposed monotonicity notion opens up a whole new direction of research.

研究动机与目标

  • 形式化直观预期:学习性能应随训练数据增多而改善或至少不恶化。
  • 挑战普遍假设:学习曲线单调递减,通过在标准学习设置中展示反例。
  • 为风险单调性建立理论基础,作为监督学习泛化行为的新属性。
  • 探究经验风险最小化(ERM)学习器在训练样本上的期望下是否可能表现出非单调行为。
  • 探讨非单调性对模型选择、数据收集以及泛化理论理解的影响。

提出的方法

  • 提出风险单调性作为正式标准:随着训练集规模增大,期望风险不应上升。
  • 通过理论推导和边界分析,研究分类、回归和密度估计中的经验风险最小化器。
  • 基于记忆型学习器的反例,表明即使VC维无限,非单调性仍可能发生。
  • 推导出非单调性的条件:若损失减少率低于 n/(n+1),则发生非单调性。
  • 应用学习理论结果,如对抗学习器的 √(n/(n+1)) 收敛率,以评估单调性潜力。
  • 在理论分析难以处理的情况下,提供实验验证,以强化理论发现。

实验结果

研究问题

  • RQ1经验风险最小化器是否可能表现出非单调的学习曲线,即使在训练集规模任意增大时?
  • RQ2在损失函数或学习算法上,哪些条件会导致尽管数据增加,风险行为仍为非单调?
  • RQ3风险单调性与PAC可学习性有何关系?是否存在可PAC学习但非单调的学习器?
  • RQ4是否存在特定的损失函数或正则化策略,可使ERM中实现风险单调性?
  • RQ5在多大程度上,可从底层分布特性预测学习曲线的形状?

主要发现

  • 在分类、回归和密度估计中,经验风险最小化器在期望风险上可能表现出非单调行为,即使在大样本量下也是如此。
  • 非单调性的条件被推导为损失比值:若每样本损失减少率低于 n/(n+1),则发生非单调性。
  • 展示了具有无限VC维的记忆型学习器是风险单调的,表明单调性并不蕴含PAC可学习性。
  • 理论分析表明,以 √(n/(n+1)) 速率收敛的对抗学习器,仍可能表现出非单调性,因为该速率对所有有限 n 均超过 n/(n+1)。
  • 研究结果表明,非单调性并非有限样本或实验设计不佳的产物,而是某些ERM过程的根本属性。
  • 结果表明,风险单调性是一个独立且未被充分探索的属性,与PAC可学习性不同,对模型评估和数据收集具有重要意义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。