Skip to main content
QUICK REVIEW

[论文解读] Uncertainty Aware Learning for High Energy Physics

A. Ghosh, Benjamin Nachman|arXiv (Cornell University)|May 18, 2021
Particle physics theoretical and experimental studies参考文献 32被引用 5
一句话总结

本文提出了一种在高能物理中考虑不确定性的分类器,该方法在训练过程中显式建模对干扰参数的依赖关系,从而在传统方法的基础上提升了敏感度。通过训练模型对系统不确定性保持敏感,而非与之解耦,该方法在高斯分布和希格斯玻色子衰变(H→ττ)数据集上均表现出更优性能,尤其在系统性偏移发生时表现更佳。

ABSTRACT

Machine learning techniques are becoming an integral component of data analysis in High Energy Physics (HEP). These tools provide a significant improvement in sensitivity over traditional analyses by exploiting subtle patterns in high-dimensional feature spaces. These subtle patterns may not be well-modeled by the simulations used for training machine learning methods, resulting in an enhanced sensitivity to systematic uncertainties. Contrary to the traditional wisdom of constructing an analysis strategy that is invariant to systematic uncertainties, we study the use of a classifier that is fully aware of uncertainties and their corresponding nuisance parameters. We show that this dependence can actually enhance the sensitivity to parameters of interest. Studies are performed using a synthetic Gaussian dataset as well as a more realistic HEP dataset based on Higgs boson decays to tau leptons. For both cases, we show that the uncertainty aware approach can achieve a better sensitivity than alternative machine learning strategies.

研究动机与目标

  • 应对基于机器学习的高能物理分析中系统不确定性日益增长的挑战。
  • 挑战传统方法中使分类器对干扰参数不敏感的常规做法。
  • 通过在学习过程中显式引入不确定性感知,提升对感兴趣参数的敏感度。
  • 证明在训练过程中最大化对干扰参数的依赖关系,可在系统性偏移下实现更优性能。
  • 为将不确定性感知集成到现有的大型强子对撞机(LHC)分析工作流中,提供实用框架。

提出的方法

  • 训练一个显式依赖于干扰参数作为输入特征的参数化分类器。
  • 使用基于似然的损失函数,以考虑完整的不确定性结构,包括干扰参数。
  • 将不确定性感知分类器与基线方法、数据增强方法以及对抗性训练基线进行比较。
  • 在评估过程中对干扰参数进行轮廓分析,为每个值选择最优分类器。
  • 将该方法应用于一个合成的高斯数据集和一个真实的希格斯玻色子衰变(H→ττ)数据集。
  • 使用轮廓化负对数似然(NLL)曲线来评估敏感度和不确定性量化效果。

实验结果

研究问题

  • RQ1一个显式对干扰参数保持敏感的机器学习分类器,是否能在系统不确定性存在的情况下优于传统方法?
  • RQ2与数据增强和对抗性训练相比,不确定性感知训练在敏感度和鲁棒性方面表现如何?
  • RQ3当引入了不确定性感知后,干扰参数的系统性偏移对分类器性能有何影响?
  • RQ4最大化对干扰参数的依赖关系是否能提升高能物理测量的整体敏感度?
  • RQ5不确定性感知分类器是否可实际应用于真实的LHC分析,且计算开销极低?

主要发现

  • 当真实干扰参数(z)偏离训练时假设的值时,不确定性感知分类器仍能保持理想性能,而基线分类器则无法做到。
  • 在高斯示例中,当发生系统性偏移时,不确定性感知分类器的轮廓化NLL曲线比基线、数据增强和对抗性方法更窄。
  • 在H→ττ数据集中,当真实μ值为1时,不确定性感知分类器在敏感度方面优于所有基线方法,尤其是在系统性偏移(z=0.8和z=1.1)条件下表现更优。
  • 当数据生成时z=1.0(标称值)时,所有分类器表现良好,但不确定性感知方法在非标称条件下仍保持更优性能。
  • 该方法对干扰参数的偏移具有鲁棒性,并通过在轮廓分析过程中根据干扰参数的真实值动态调整分类器,实现了更精确的测量。
  • 该方法计算上可行,可仅通过少量修改集成到现有的LHC分析工作流中,为受系统不确定性限制的分析提供了显著性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。