[论文解读] Direct optimisation of the discovery significance when training neural networks to search for new physics in particle colliders
本文提出了两种新颖的神经网络损失函数——分别针对 s/√(s+b) 和 Asimov 显著性估计进行优化——直接在粒子物理搜索中最大化统计发现显著性。在使用 30 fb⁻¹ 的 14 TeV LHC 模拟数据训练压缩型 SUSY 搜索时,基于 Asimov 的损失函数优于二元交叉熵,尤其在高系统不确定性下,实现了 9.9 ± 1.6σ 的显著性,而标准交叉熵仅达到 6.4 ± 0.7σ,这是由于所选区域的信号纯度更高。
We introduce two new loss functions designed to directly optimise the statistical significance of the expected number of signal events when training neural networks to classify events as signal or background in the scenario of a search for new physics at a particle collider. The loss functions are designed to directly maximise commonly used estimates of the statistical significance, $s/\sqrt{s+b}$, and the Asimov estimate, $Z_A$. We consider their use in a toy SUSY search with 30~fb$^{-1}$ of 14~TeV data collected at the LHC. In the case that the search for the SUSY model is dominated by systematic uncertainties, it is found that the loss function based on $Z_A$ can outperform the binary cross entropy in defining an optimal search region.
研究动机与目标
- 为解决标准分类损失函数(如二元交叉熵)与新物理搜索真实目标之间的错配问题:即最大化统计显著性而非准确率。
- 开发直接优化预期发现显著性的损失函数,特别是 s/√(s + b) 和 Asimov Z 估计,用于神经网络训练。
- 评估在系统不确定性占主导的场景下,这些显著性优化损失是否能提升性能,特别是在具有挑战性的压缩型 SUSY 模型中。
- 证明直接优化显著性可带来更高的信号纯度和更优的分离能力,优于标准训练目标。
提出的方法
- 提出两种新损失函数:ℓs/√(s+b) 和 ℓAsimov,直接优化信号与背景的预期统计显著性。
- 损失通过从网络输出得分中估算的信号(s)和背景(b)事件数计算,显著性使用 Asimov 公式 ZA = (s + b) / √(s + b) 和 s/√(s + b) 进行比较。
- 使用随机梯度下降训练网络,采用基于显著性的损失函数,数据集为预选的 140 万个事件(信号与背景各占 50%),来自模拟的停夸克对产生搜索。
- 输入特征包括主要喷注和轻子的低水平变量(如能量、横动量、伪快度等),以及高水平变量如 HT、ET/ 和 mT。
- 使用独立的 60 万个事件测试样本进行唯一评估,以避免数据泄露。
- 通过扫描分类器得分截断点并使用泊松误差传播系统不确定性,计算 Asimov 显著性来评估性能。
实验结果
研究问题
- RQ1在神经网络训练期间直接优化统计显著性,是否能提升新物理搜索中的发现灵敏度?
- RQ2基于 Asimov 显著性估计的损失函数是否在系统不确定性下表现优于标准二元交叉熵,带来更高的信号纯度与显著性?
- RQ3在信号与背景动力学相近但背景占主导的压缩型 SUSY 模型中,新损失函数表现如何?
- RQ4显著性优化损失带来的性能增益是否依赖于背景的系统不确定性水平?
主要发现
- 在非压缩型 SUSY 模型(900 GeV 停夸克,100 GeV LSP)中,三种损失函数——二元交叉熵、ℓs/√(s+b) 和 ℓAsimov——表现相似,因为统计不确定性主导了显著性。
- 在压缩型 SUSY 模型(600 GeV 停夸克,400 GeV LSP)中,系统不确定性占主导,ℓAsimov 损失实现了 9.9 ± 1.6σ 的显著性(50% 系统不确定性),显著优于二元交叉熵的 6.4 ± 0.7σ。
- 经过 ℓAsimov 优化的网络实现了约 30 的信号纯度(s/b),而二元交叉熵为约 6,ℓs/√(s+b) 仅为约 1,表明其具有更优的信号富集能力。
- ℓs/√(s+b) 损失在压缩模型中表现不佳,因其未考虑系统不确定性,导致信号纯度仅约 1。
- ℓAsimov 损失对截断点选择具有鲁棒性,在分类器得分截断高于 ∼0.5 时均能保持最优性能,降低了超参数调优需求。
- 在 ℓAsimov 优化前使用 ℓs/√(s+b) 进行预训练,显著缩短了训练时间,表明这是一种实用的训练策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。