Skip to main content
QUICK REVIEW

[论文解读] PELICAN: Permutation Equivariant and Lorentz Invariant or Covariant Aggregator Network for Particle Physics

Alexander Bogatskiy, Timothy J. Hoffman|arXiv (Cornell University)|Nov 1, 2022
Computational Physics and Python Applications被引用 10
一句话总结

PELICAN 是一种用于粒子物理的新型神经网络架构,通过使用成对四维动量点积作为输入,强制实现排列等变性以及洛伦兹不变性/协变性。它在顶夸克喷注识别和 W 玻色子四维动量重建任务中实现了最先进性能,且模型复杂度显著低于现有方法。

ABSTRACT

Many current approaches to machine learning in particle physics use generic architectures that require large numbers of parameters and disregard underlying physics principles, limiting their applicability as scientific modeling tools. In this work, we present a machine learning architecture that uses a set of inputs maximally reduced with respect to the full 6-dimensional Lorentz symmetry, and is fully permutation-equivariant throughout. We study the application of this network architecture to the standard task of top quark tagging and show that the resulting network outperforms all existing competitors despite much lower model complexity. In addition, we present a Lorentz-covariant variant of the same network applied to a 4-momentum regression task.

研究动机与目标

  • 开发一种尊重粒子物理基本对称性的机器学习架构,特别是洛伦兹不变性和排列等变性。
  • 通过将物理约束直接嵌入网络架构中,降低模型复杂度,提升可解释性和泛化能力。
  • 在不依赖高参数架构的前提下,超越现有通用深度学习模型在喷注识别和四维动量重建任务中的表现。
  • 即使在存在探测器效应的情况下,也能实现对顶夸克衰变喷注中 W 玻色子四维动量的精确重建。
  • 证明对称性感知架构可实现优于标准深度学习方法的性能,且参数更少。

提出的方法

  • 网络使用喷注成分的四维动量矢量导出的所有洛伦兹不变成对点积 $p_i \cdot p_j$ 作为输入特征。
  • 采用基于参考文献 [7, 19] 框架的排列等变层,确保在粒子顺序排列变换下保持等变性。
  • 架构采用类似消息传递的聚合方案,在多层中保持等变性,从而能够建模高阶相互作用。
  • 对于回归任务,网络从顶夸克衰变中预测 W 玻色子的完整四维动量,损失函数基于 $p_T$、质量及角分辨率。
  • 使用少量参数(回归任务为 36k)进行端到端训练,通过对称性降低模型容量。
  • 在真实事件级和 DELPHES 模拟的探测器级数据集上对网络进行评估,以检验其对实验效应的鲁棒性。

实验结果

研究问题

  • RQ1能否通过强制实现洛伦兹不变性和排列等变性的神经网络架构,在降低模型复杂度的同时实现喷注识别的最先进性能?
  • RQ2与通用深度学习模型相比,对称性感知设计在粒子物理任务中如何提升泛化能力和鲁棒性?
  • RQ3此类尊重对称性的架构能否准确地从顶夸克衰变喷注中重建 W 玻色子的四维动量?
  • RQ4使用不变点积作为输入是否可消除在聚合阶段对复杂、宽全连接层的需求?
  • RQ5PELICAN 在动量重建任务中的性能与约翰霍普金斯标签器等成熟非机器学习方法相比如何?

主要发现

  • PELICAN 仅使用 12k 个参数即实现了最先进喷注识别性能,显著少于竞争模型。
  • 在无探测器模拟的动量重建任务中,PELICAN 实现了 $\sigma_{p_T} = 0.83\%$ 和 $\sigma_m = 1.21\%$,优于约翰霍普金斯标签器($\sigma_{p_T} = 0.70\%$,$\sigma_m = 1.29\%$)在相同数据上的表现。
  • 在完全包含的喷注子集上,PELICAN 实现了 $\sigma_{p_T} = 0.32\%$ 和 $\sigma_m = 0.76\%$,相较于全连接基线模型表现更优。
  • 在 DELPHES 模拟的探测器效应下,PELICAN 将 $p_T$ 分辨率误差从 10.8%(JH)降低至 5.6%,质量分辨率从 8.3% 降低至 3.2%。
  • 即使在探测器效应下,网络仍保持高性能,角分辨率误差为 $\sigma_{\psi} = 4.2$ centirad,优于 JH 基线的 8.9。
  • 在 JH 标签子集上,PELICAN 实现了 $\sigma_{p_T} = 0.28\%$,表明其重建动量的精度高于原始标签器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。