Skip to main content
QUICK REVIEW

[论文解读] Optimization of Signal Significance by Bagging Decision Trees

I. Narsky|CaltechAUTHORS (California Institute of Technology)|Jul 21, 2005
Particle physics theoretical and experimental studies被引用 6
一句话总结

该论文提出了一种基于自助采样(bagging)的决策树算法,通过在自助样本上训练每棵树以最大化信号显著性(而非传统的基尼指数等标准准则),直接优化高能物理(HEP)数据分析中的关键性能指标——信号显著性。在B BaBar实验中对B→γeν衰变的搜索中,该方法相比使用决策树的AdaBoost,将信号显著性提升了14%,优于包括神经网络和标准提升方法在内的其他分类器。

ABSTRACT

An algorithm for optimization of signal significance or any other classification figure of merit suited for analysis of high energy physics (HEP) data is described. This algorithm trains decision trees on many bootstrap replicas of training data with each tree required to optimize the signal significance or any other chosen figure of merit. New data are then classified by a simple majority vote of the built trees. The performance of this algorithm has been studied using a search for the radiative leptonic decay B->gamma l nu at BaBar and shown to be superior to that of all other attempted classifiers including such powerful methods as boosted decision trees. In the B->gamma e nu channel, the described algorithm increases the expected signal significance from 2.4 sigma obtained by an original method designed for the B->gamma l nu analysis to 3.0 sigma.

研究动机与目标

  • 为解决缺乏直接优化高能物理特有性能指标(如信号显著性)的分类器的问题。
  • 通过在自助样本上训练决策树以最大化信号显著性,提升高能物理中的信号-背景分离能力。
  • 开发一种稳定、高效且可解释的显著性优化方法,其性能优于现有的分类器(如AdaBoost和神经网络)。
  • 为高能物理分析人员提供一个在StatPatternRecognition包中免费可用的实现。

提出的方法

  • 在训练数据的自助样本上训练多棵决策树,其中每棵树均被优化以最大化信号显著性,而非传统的标准准则(如基尼指数)。
  • 通过所有树的多数投票(接受率的代数和)组合预测结果,对新事件进行分类。
  • 使用验证样本调整最小终端节点大小(100个事件),以平衡过拟合与性能。
  • 将该方法应用于真实高能物理分析:利用11个物理变量在B BaBar实验中搜索B→γlν衰变。
  • 使用测试数据评估性能,并与AdaBoost、神经网络以及采用不同优化准则的决策树等多类分类器进行信号显著性比较。
  • 探索扩展方法,如结合变量子采样的随机森林,其性能仅比标准自助采样方法提升1%。

实验结果

研究问题

  • RQ1能否设计一种自助采样算法,通过直接优化信号显著性来超越高能物理数据分析中的标准分类器?
  • RQ2与通过中间分类器(如AdaBoost或神经网络)间接优化信号显著性相比,直接优化信号显著性有何差异?
  • RQ3将信号显著性作为树分裂准则,与使用传统准则(如基尼指数)相比,其影响如何?
  • RQ4当使用相同的优化准则时,通过自助采样组合树是否比提升方法带来更高的信号显著性?
  • RQ5该方法能否在高维高能物理数据中保持稳定和高效,尤其是在神经网络无法收敛的情况下?

主要发现

  • 所提出的自助采样算法在B→γeν通道中实现了3.0σ的信号显著性,相比原始方法(2.4σ)提升了24%。
  • 在B→γeν通道中,该算法相比使用基尼指数优化的决策树的AdaBoost,将信号显著性提升了14%。
  • 与使用基尼指数优化的树在自助采样框架中相比,使用自助采样而非提升方法显著贡献了性能提升,信号显著性高出9%。
  • 结合变量子采样的随机森林变体相比标准自助采样方法仅带来1%的边际性能提升。
  • 尽管在二次或指数误差下误判了大量信号事件,该方法仍成功识别出能最大化信号显著性的区域。
  • 该方法表现稳定且高效,训练时间与AdaBoost相当,并在高维数据设置中优于不稳定的神经网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。