[论文解读] Uncovering hidden patterns in collider events with Bayesian probabilistic models
该论文提出一种基于潜在狄利克雷分配(LDA)的贝叶斯概率模型,无需标注数据即可在强子对撞机事例中揭示隐藏的新物理模式。通过将喷注亚结构测量视为吕恩平面中可交换的离散标记,该模型学习到两个隐含的'主题'——一个捕捉QCD背景,另一个在信号-背景比为5%时识别出$W'\!-\!\phi$的BSM信号,展示了在无监督条件下成功发现新物理特征的能力。
Individual events at high-energy colliders like the LHC can be represented by a sequence of measurements, or 'point patterns' in an observable space. Starting from this data representation, we build a simple Bayesian probabilistic model for event measurements useful for unsupervised event classification in beyond the standard model (BSM) studies. In order to arrive to this model we assume that the event measurements are exchangeable (and apply De Finetti's representation theorem), the data is discrete, and measurements are generated from multiple 'latent' distributions, called 'themes'. The resulting probabilistic model for collider events is a mixed-membership model known as Latent Dirichlet Allocation (LDA), a model extensively used in natural language processing applications. By training on point patterns in the primary Lund plane, we demonstrate that a two-theme LDA model can learn to distinguish in unlabelled dijet events the hidden new physics patterns produced by a BSM signature from a much larger QCD background. Based on 1904.04200 and 2005.12319.
研究动机与目标
- 开发一种简单且可解释的贝叶斯概率模型,用于高能对撞机物理中的无监督事例分类。
- 在无先验标注的情况下,从喷注亚结构数据中检测隐藏的新物理信号特征。
- 应用可交换性与离散标记化方法,将对撞机事例建模为混合成员关系过程。
- 评估LDA是否能从未标注的事例样本中,从主导的QCD背景里提取稀少的BSM信号。
- 证明受自然语言处理启发的模型在高能物理事例分析中的可行性。
提出的方法
- 将对撞机事例表示为可观测空间中可交换的测量序列,从而应用德·菲内蒂表示定理。
- 将连续可观测量(如吕恩平面变量)离散化为区间,将测量建模为离散标记。
- 应用潜在狄利克雷分配(LDA),一种混合成员关系模型,以学习隐含的'主题',代表在离散可观测量空间上的潜在概率分布。
- 使用具有非对称浓度参数($\alpha_0 \approx 0.9$,$\alpha_2 \approx 0.1$)的狄利克雷先验,使一个主题偏向QCD类模式,另一个偏向稀少的BSM特征。
- 使用Gensim库在10万例未标注的二喷注事例上训练LDA模型,其中嵌入了$W'\!-\!\phi$信号,信号-背景比为5%。
- 利用学习到的主题重建并对比主吕恩平面上真实事例的信号与背景分布。
实验结果
研究问题
- RQ1对撞机事例测量的可交换性与离散标记化是否能支持构建一种原则性的贝叶斯无监督事例分类模型?
- RQ2LDA是否能有效学习并分离未标注的二喷注事例中QCD背景模式与稀少BSM信号特征?
- RQ3在仅5%信号-背景比的混合样本上训练的双主题LDA模型,是否能成功恢复吕恩平面上真实的信号结构?
- RQ4LDA中的隐含主题是否可解释为对应于已知QCD与BSM喷注亚结构模式的物理上有意义的分布?
- RQ5受自然语言处理启发的模型在稀疏且不规则形状的对撞机事例模式中,能在多大程度上检测到细微且非均匀的特征?
主要发现
- 双主题LDA模型成功学习到第一个主题,其与主吕恩平面上真实事例的QCD背景分布高度一致。
- 第二个主题捕捉到了与$W'\!\to\!W\phi\to\!WW\!\to\!jjjj$衰变链相关的吕恩平面上特有的双簇结构,这是BSM信号的特征。
- 尽管信号-背景比仅为5%,该模型仍以无监督方式识别并分离出非QCD信号模式。
- 学习到的主题表明,LDA能够从未稀疏、不规则形状的吕恩平面事例模式中提取出物理相关的特征。
- 通过将学习到的主题与真实事例分布进行视觉对比,验证了模型性能,显示出与背景和信号结构的强烈一致性。
- 结果证实,当应用于离散化的喷注亚结构可观测量时,LDA能够有效实现高能对撞机数据中无监督新物理信号的发现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。