Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation at the LHC through Analysis-specific Fast Simulation with Deep Learning

Cheng Chen, Olmo Cerri|arXiv (Cornell University)|Oct 5, 2020
Particle physics theoretical and experimental studies参考文献 16被引用 5
一句话总结

本文提出了一种基于深度学习的快速模拟方法,将探测器分辨率效应建模为生成器级别特征上的转移函数,实现了分析特定的数据增强,将计算和存储成本降低了约10倍。该方法通过训练神经网络从生成器级别输入预测探测器级别可观测量,在更大数据集上仍保持高保真度和鲁棒性,为高亮度LHC时代提供了可扩展的解决方案。

ABSTRACT

We present a fast simulation application based on a Deep Neural Network, designed to create large analysis-specific datasets. Taking as an example the generation of W+jet events produced in sqrt(s)= 13 TeV proton-proton collisions, we train a neural network to model detector resolution effects as a transfer function acting on an analysis-specific set of relevant features, computed at generation level, i.e., in absence of detector effects. Based on this model, we propose a novel fast-simulation workflow that starts from a large amount of generator-level events to deliver large analysis-specific samples. The adoption of this approach would result in about an order-of-magnitude reduction in computing and storage requirements for the collision simulation workflow. This strategy could help the high energy physics community to face the computing challenges of the future High-Luminosity LHC.

研究动机与目标

  • 解决LHC实验中基于全GEANT4模拟工作流日益增长的计算与存储负担。
  • 降低生成合成碰撞数据的资源需求,尤其针对高精度测量。
  • 开发一种快速、分析特定的模拟方法,与下游重建软件兼容。
  • 在不依赖全探测器模拟的情况下,实现复杂物理分析的大规模数据增强。
  • 支持LHC社区应对高亮度LHC阶段的计算挑战。

提出的方法

  • 训练深度神经网络,将探测器分辨率效应建模为作用于分析特定生成器级别特征的转移函数。
  • 采用基于回归的架构,并结合高斯采样,从生成器级别输入生成逼真的探测器级别可观测量。
  • 聚焦于一组最小的相关物理量(例如,重建对象的四momenta),而非完整的事件图像。
  • 在大规模生成器级别数据集上训练模型,学习从理想化粒子级别输入到探测器级别输出的映射关系。
  • 应用训练好的模型生成无需运行全GEANT4模拟的大规模分析特定数据集。
  • 通过在多种特征类型上比较模拟与预测量之间的相对残差分布,对模型进行验证。

实验结果

研究问题

  • RQ1深度学习模型是否能在无需全GEANT4模拟的情况下,准确从生成器级别输入预测探测器级别可观测量?
  • RQ2当该模型应用于远大于训练集规模的数据集时,其准确性保持程度如何?
  • RQ3与传统模拟方法相比,该方法在计算和存储效率方面表现如何?
  • RQ4该模型是否可用于生成具有最小系统性不确定性的大规模、分析特定数据集?
  • RQ5该模型是否足够鲁棒,能够支持高亮度LHC时代下的高精度测量?

主要发现

  • 与全GEANT4模拟相比,所提方法在计算和存储需求方面均实现了约一个数量级的降低。
  • 模型保持了高精度,输入和辅助特征预测中相关性较强,且残差分布围绕对角线对称。
  • 该模型在比训练集大五倍的数据集上泛化良好,未观察到性能下降。
  • 基于回归的方法结合高斯采样在性能上表现良好,且相比生成对抗网络(GANs)更简单、更稳定。
  • 轻量级的推理与训练支持集成建模,可通过预测分布范围实现系统性不确定性的估计。
  • 该方法与标准分析工作流兼容,并生成可被下游重建软件直接使用的数据格式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。