[论文解读] Learning the EFT likelihood with tree boosting
本文提出一种树提升算法——增强信息树(Boosted Information Trees, BIT),用于在大型强子对撞机(LHC)的多参数测量中学习有效场论(EFT)分析中的似然比。通过在具有事件级信息的模拟事件数据上进行训练,BIT 以威尔逊系数的各阶展开方式近似微分截面比,实现与似然比检验相当的近似最优统计功效,相较于基线的 $p_{\textrm{T,Z}}$-基方法,在排除能力方面有显著提升。
We develop a tree boosting algorithm for collider measurements of multiple Wilson coefficients in effective field theories describing phenomena beyond the standard model of particle physics. The design of the discriminant exploits per-event information of the simulated data sets that encodes the predictions for different values of the Wilson coefficients. This ``Boosted Information Tree'' algorithm provides nearly optimal discrimination power order-by-order in the expansion in the Wilson coefficients and approaches the optimal likelihood ratio test statistic. As a proof-of-principle, we apply the algorithm to the $ extrm{pp} ightarrow extrm{Zh}$ process for different types of modeling.
研究动机与目标
- 开发一种在标准模型有效场论(SM-EFT)中使用对撞机数据测量多个威尔逊系数的统计最优且可扩展的方法。
- 克服全局EFT拟合中高维特征空间与复杂参数空间的挑战。
- 通过基于树的回归方法,实现在顺序上对微分截面比的高效估计。
- 在真实模拟设置下,证明BIT在排除灵敏度方面优于传统的 $p_{\textrm{T,Z}}$-基策略。
- 建立一个利用事件级模拟数据训练模型的框架,以近似真实探测器级似然。
提出的方法
- 该方法使用树提升回归微分截面比 $\hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$,作为事件特征 $\boldsymbol{x}$ 的函数,采用均方误差(MSE)损失函数。
- 将截面比在 $\boldsymbol{\theta}_0$ 附近展开为泰勒级数,每一阶由独立的树提升回归器估计。
- 弱学习器为CART决策树,基于包含SM-EFT依赖关系的加权模拟事件进行训练,以编码系数函数。
- 通过在训练数据上最小化MSE损失,逐步提升 $\hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$ 的估计精度。
- 最终的检验统计量 $\hat{q}(\mathcal{D}) = -\log \hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$ 用于假设检验与排除限值分析。
- 引入了估算器的分箱版本,即使在高阶EFT项不确定时也能保持最优性,通过将训练与感兴趣的系数解耦实现。
实验结果
研究问题
- RQ1树提升能否用于在多参数EFT测量中学习似然比,并实现接近最优的统计功效?
- RQ2在真实的LHC模拟条件下,增强信息树(BIT)方法在多大程度上近似真实似然比?
- RQ3BIT在威尔逊系数的排除能力方面是否优于传统的 $p_{\textrm{T,Z}}$-基分析策略?
- RQ4当威尔逊系数展开中的高阶项被忽略或存在不确定性时,该方法在多大程度上仍保持最优性?
- RQ5BIT框架能否应用于包含背景和探测器效应的真实事件生成器?
主要发现
- BIT方法在假设检验中实现了近乎最优的判别能力,其性能接近奈曼-皮尔逊引理所保证的真实似然比检验统计量。
- 在 $\mathrm{pp} \to \mathrm{Z}h$ 过程的简化模型中,基于BIT的检验统计量展现出最优功效与准确的排除轮廓,验证了其理论最优性。
- 在包含背景的MadGraph5_aMC@NLO真实模拟中,BIT相较于使用神经网络分类器的 $p_{\textrm{T,Z}}$-基策略,显著提升了排除能力。
- BIT估计器的分箱版本即使在高阶EFT项不确定时仍能保持最优性能,通过将训练与感兴趣的系数解耦实现。
- 该方法提供了一种简单、解析的检验统计量,具有直接可解释性,支持分箱与非分箱的假设检验。
- 该算法在威尔逊系数数量增加时仍能高效扩展,所需回归器数量仅与EFT展开的阶数成正比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。