Skip to main content
QUICK REVIEW

[论文解读] Learning to Diversify via Weighted Kernels for Classifier Ensemble

Xu-Cheng Yin, Chun Yang|arXiv (Cornell University)|Jun 4, 2014
Face and Expression Recognition参考文献 34被引用 12
一句话总结

本文提出L2DWK,一种新型的分类器集成方法,通过联合优化分类器权重与核权重以同时最大化准确率与自适应多样性,实现分类器的多样化学习。通过将组合问题建模为带加权核多样性约束的凸优化问题,L2DWK在32个UCI数据集上均优于最先进集成方法,展现出准确率与多样性之间强大且自适应的关联。

ABSTRACT

Classifier ensemble generally should combine diverse component classifiers. However, it is difficult to give a definitive connection between diversity measure and ensemble accuracy. Given a list of available component classifiers, how to adaptively and diversely ensemble classifiers becomes a big challenge in the literature. In this paper, we argue that diversity, not direct diversity on samples but adaptive diversity with data, is highly correlated to ensemble accuracy, and we propose a novel technology for classifier ensemble, learning to diversify, which learns to adaptively combine classifiers by considering both accuracy and diversity. Specifically, our approach, Learning TO Diversify via Weighted Kernels (L2DWK), performs classifier combination by optimizing a direct but simple criterion: maximizing ensemble accuracy and adaptive diversity simultaneously by minimizing a convex loss function. Given a measure formulation, the diversity is calculated with weighted kernels (i.e., the diversity is measured on the component classifiers' outputs which are kernelled and weighted), and the kernel weights are automatically learned. We minimize this loss function by estimating the kernel weights in conjunction with the classifier weights, and propose a self-training algorithm for conducting this convex optimization procedure iteratively. Extensive experiments on a variety of 32 UCI classification benchmark datasets show that the proposed approach consistently outperforms state-of-the-art ensembles such as Bagging, AdaBoost, Random Forests, Gasen, Regularized Selective Ensemble, and Ensemble Pruning via Semi-Definite Programming.

研究动机与目标

  • 为解决通过自适应多样性而非依赖固定多样性度量来实现高集成准确率的挑战。
  • 建立准确率与多样性之间清晰、数据自适应的关联,克服以往研究中观察到的相关性不一致问题。
  • 开发一个统一框架,同时学习最优分类器权重与核权重以衡量多样性。
  • 提出一种自训练算法,在凸最小化设置下迭代优化分类器权重与核权重。
  • 通过实证验证,基于核化与加权分类器输出测量的自适应多样性可持续提升集成性能。

提出的方法

  • 将分类器集成建模为一个凸最小化问题,联合最大化准确率与自适应多样性。
  • 引入加权核以测量分类器输出的多样性,其中核权重可自动学习,以反映数据分布与噪声特性。
  • 采用自训练算法迭代估计分类器权重与核权重,确保收敛至最优解。
  • 使用L2DWK-Hinge损失函数计算并更新核权重,实现在不同数据条件下的鲁棒优化。
  • 应用三种核类型——线性、高斯与多项式,提升对多样化数据分布的建模灵活性。
  • 采用10折交叉验证,结合自助采样验证集,并使用包含301个基分类器(来自Bagging与随机森林)的大规模分类器池,以实现稳健评估。

实验结果

研究问题

  • RQ1通过分类器输出上的加权核测量的自适应多样性,能否有效关联到集成准确率的提升?
  • RQ2同时学习分类器权重与核权重是否优于固定多样性度量或标准集成方法?
  • RQ3所提出的L2DWK方法在多样化数据集上与最先进集成方法(如Bagging、AdaBoost、随机森林与Gasen)相比表现如何?
  • RQ4不同核类型及多样性控制参数λ对L2DWK性能有何影响?
  • RQ5在所提出的核加权框架下,自适应多样性与集成准确率之间是否存在一致且正向的相关性?

主要发现

  • L2DWK在全部32个UCI基准数据集上持续优于最先进集成方法,包括Bagging、AdaBoost、随机森林、Gasen、正则化选择性集成与基于半定规划的集成剪枝方法。
  • 与不随数据噪声或分布自适应的常规多样性度量相比,使用核加权多样性可显著提升集成准确率。
  • 用于联合优化分类器与核权重的自训练算法收敛稳定,且仅需极少调参即可实现优异性能。
  • 采用高斯核与多项式核的L2DWK展现出强泛化能力,在特征维度与类别不平衡程度各异的数据集上性能均保持稳定。
  • 实验结果证实,通过学习到的核权重测量的自适应多样性,与集成准确率之间具有更强且更一致的相关性,优于固定多样性指标。
  • 消融研究显示,同时包含准确率与多样性正则化组件并结合加权核的设置性能最佳,验证了双重优化目标的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。