Skip to main content
QUICK REVIEW

[论文解读] Learning to Benchmark: Determining Best Achievable Misclassification Error from Training Data

Morteza Noshad, Li Xu|arXiv (Cornell University)|Sep 16, 2019
Imbalanced Data Classification Techniques参考文献 20被引用 4
一句话总结

该论文提出了一种学习性基准框架,通过使用ε-球估计器的集成与切比雪夫逼近,直接从训练数据中估计精确的贝叶斯误分类错误率。在光滑性假设下,该方法实现了O(N⁻¹)的参数化均方误差率,相较于以往基于界限的方法,在模拟和真实数据集上均展现出更高的准确性和更快的收敛速度。

ABSTRACT

We address the problem of learning to benchmark the best achievable classifier performance. In this problem the objective is to establish statistically consistent estimates of the Bayes misclassification error rate without having to learn a Bayes-optimal classifier. Our learning to benchmark framework improves on previous work on learning bounds on Bayes misclassification rate since it learns the {\it exact} Bayes error rate instead of a bound on error rate. We propose a benchmark learner based on an ensemble of $ε$-ball estimators and Chebyshev approximation. Under a smoothness assumption on the class densities we show that our estimator achieves an optimal (parametric) mean squared error (MSE) rate of $O(N^{-1})$, where $N$ is the number of samples. Experiments on both simulated and real datasets establish that our proposed benchmark learning algorithm produces estimates of the Bayes error that are more accurate than previous approaches for learning bounds on Bayes error probability.

研究动机与目标

  • 开发一种无需依赖贝叶斯最优分类器的精确贝叶斯误分类错误率的统计一致估计器。
  • 通过学习精确错误率而非仅提供贝叶斯错误率的界限,改进现有方法。
  • 在类别密度满足光滑性假设的条件下,实现贝叶斯错误率估计的最优参数化收敛速率。
  • 设计一种具有闭式最优权重的集成估计框架,利用切比雪夫节点以提升有限样本下的性能。
  • 将该框架扩展至多分类问题,并提供可证明的收敛速率。

提出的方法

  • 针对二分类问题,提出一种基于ε-球密度比估计的基估计器,利用局部邻域统计信息。
  • 采用切比雪夫节点构建基估计器的加权集成,以最小化估计过程中的近似误差。
  • 利用切比雪夫多项式逼近推导出集成的闭式最优权重,确保最小化均方误差。
  • 推导出基估计器与集成估计器的理论收敛速率,在光滑性条件下证明了最优的O(N⁻¹)均方误差率。
  • 通过将ε-球与集成估计方法推广至λ ≥ 3类,将框架扩展至多分类问题。
  • 采用一致的经验估计器对ε-球内的密度比进行估计,从而实现从有限训练样本出发的非参数估计。

实验结果

研究问题

  • RQ1我们能否在不学习贝叶斯最优分类器的前提下,直接从训练数据中估计精确的贝叶斯错误率?
  • RQ2基于切比雪夫节点加权的ε-球估计器集成是否比现有基于界限的方法具有更快的收敛速度?
  • RQ3在类别密度满足光滑性假设的条件下,贝叶斯错误率估计可实现的最优均方误差率是多少?
  • RQ4所提出的基准学习器在估计可实现错误率方面,与XGBoost和随机森林等传统分类器相比表现如何?
  • RQ5基于切比雪夫的集成中缩放系数的选择是否会影响不同数据分布与维度下的估计精度?

主要发现

  • 所提出的基准学习器在类别密度满足光滑性假设时,实现了最优的参数化均方误差率O(N⁻¹)。
  • 在四维与一百维各向同性正态分布的实验中,当N=1600时,基于切比雪夫的集成方法相比算术加权方法将MSE降低了高达92%。
  • 对于一百维各向同性正态数据,切比雪夫方法在MSE上显著优于算术加权与均匀加权方案,展现出更优的有限样本收敛性。
  • 在不同缩放系数α ∈ [0.3, 0.5]下,估计器性能稳定,误差变化极小,表明对超参数选择具有鲁棒性。
  • 在五维β分布的三分类问题中,基准学习器收敛至真实贝叶斯错误率,而HP-散度界限即使在大样本量下仍表现出显著偏差。
  • 在具有100维特征的四分类高斯问题中,基准学习器比XGBoost与随机森林分类器更准确地预测了贝叶斯错误率,后两者因过拟合而未能捕捉真实错误界限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。