Skip to main content
QUICK REVIEW

[论文解读] Second Order PAC-Bayesian Bounds for the Weighted Majority Vote

Andrés R. Masegosa, Stephan Sloth Lorenzen|arXiv (Cornell University)|Jul 1, 2020
Machine Learning and Algorithms参考文献 31被引用 10
一句话总结

本文提出了一种用于多分类加权多数投票的二阶PAC-Bayesian界,该界考虑了基分类器之间的误差相关性,利用二阶马尔可夫不等式来约束随机化分类器的串联损失。该方法实现了更紧密的风险估计,并在不降低测试误差的情况下改善了加权,实际表现优于一阶界。

ABSTRACT

We present a novel analysis of the expected risk of weighted majority vote in multiclass classification. The analysis takes correlation of predictions by ensemble members into account and provides a bound that is amenable to efficient minimization, which yields improved weighting for the majority vote. We also provide a specialized version of our bound for binary classification, which allows to exploit additional unlabeled data for tighter risk estimation. In experiments, we apply the bound to improve weighting of trees in random forests and show that, in contrast to the commonly used first order bound, minimization of the new bound typically does not lead to degradation of the test error of the ensemble.

研究动机与目标

  • 解决一阶PAC-Bayesian界在加权多数投票中的局限性,后者忽略了误差相关性,通常在最小化时导致性能下降。
  • 通过二阶矩分析引入误差相关性,为加权多数投票建立更紧密的风险界。
  • 提供一个可最小化的界,以有效优化分类器权重,避免过度集中于表现最好的分类器。
  • 通过利用未标记数据,将该界扩展至二分类任务,以改进风险估计。
  • 通过实证验证,最小化新界可保持或提升测试误差,而一阶界通常会导致性能下降。

提出的方法

  • 推导加权多数投票期望损失的二阶马尔可夫不等式界,将其与随机化分类器的期望串联损失关联起来。
  • 使用串联损失(定义为两个独立抽取的分类器均出错的概率)来捕捉误差相关性。
  • 应用PAC-Bayesian分析,利用其经验对应物来约束期望串联损失,从而实现最小化。
  • 提出一种优化过程,通过最小化推导出的界来学习最优分类器权重。
  • 为二分类任务提出该界的专门版本,利用未标记数据来收紧风险估计。
  • 通过二阶马尔可夫不等式对切比雪夫-坎泰利不等式进行松弛,以在紧致性上优于一阶界。

实验结果

研究问题

  • RQ1能否通过考虑误差相关性的二阶PAC-Bayesian界,改进多分类加权多数投票的风险估计?
  • RQ2最小化所提出的二阶界是否能相比最小化一阶界带来更好的泛化性能?
  • RQ3该新界能否被高效最小化并应用于随机森林等实际集成方法?
  • RQ4在二分类变体中引入未标记数据如何影响界值的紧致性和性能?
  • RQ5所提出的方法是否能避免通常在最小化一阶PAC-Bayesian界时出现的性能下降?

主要发现

  • 与一阶界通常导致性能下降不同,最小化所提出的二阶界在随机森林中不会引起测试误差下降。
  • 实证评估在多个UCI数据集上的结果表明,二阶界在实践中比一阶界更紧密。
  • 在所有数据集上的平均表现中,通过新界优化的集成测试误差始终低于或与基线相当,未观察到性能下降。
  • 该界在二分类任务中的专门版本利用未标记数据改进了风险估计,增强了界值的紧致性。
  • 实验表明,基于串联损失的界在泛化性能上始终优于一阶界,尤其在分类器间存在高误差相关性时表现更优。
  • 该方法成功避免了对表现最好分类器的过度集中,保持了集成的多样性并提升了鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。