Skip to main content
QUICK REVIEW

[论文解读] Enhanced Higgs to $τ^+τ^-$ Searches with Deep Learning

Pierre Baldi, Peter Sadowski|arXiv (Cornell University)|Oct 13, 2014
Algorithms and Data Compression被引用 3
一句话总结

本文提出使用深度神经网络结合贝叶斯超参数优化,以提升大型强子对撞机(LHC)中希格斯玻色子衰变为τ轻子的搜索效果。通过自动学习低层次探测器变量中的复杂特征,该方法使发现显著性提高25%,相当于在不额外收集数据的情况下将数据集规模扩大25%。

ABSTRACT

The Higgs boson is thought to provide the interaction that imparts mass to the fundamental fermions, but while measurements at the Large Hadron Collider (LHC) are consistent with this hypothesis, current analysis techniques lack the statistical power to cross the traditional 5$σ$ significance barrier without more data. \emph{Deep learning} techniques have the potential to increase the statistical power of this analysis by \emph{automatically} learning complex, high-level data representations. In this work, deep neural networks are used to detect the decay of the Higgs to a pair of tau leptons. A Bayesian optimization algorithm is used to tune the network architecture and training algorithm hyperparameters, resulting in a deep network of eight non-linear processing layers that improves upon the performance of shallow classifiers even without the use of features specifically engineered by physicists for this application. The improvement in discovery significance is equivalent to an increase in the accumulated dataset of 25\%.

研究动机与目标

  • 为了提升希格斯玻色子衰变为τ轻子的统计功效,目前尚未达到5σ的发现阈值。
  • 通过利用深度神经网络,克服传统浅层机器学习模型在高能物理中的局限性。
  • 系统性地使用贝叶斯优化对深度网络超参数进行调优,以最大化分类性能。
  • 评估基于低层次探测器变量训练的深度网络是否能优于或匹配基于物理学家手工构建的高层次特征训练的浅层网络。
  • 确定深度学习是否能自动学习到与物理学家手工推导的判别性模式等效的模式。

提出的方法

  • 使用随机梯度下降配合每批100个样本的mini-batch,训练了一个具有八个非线性隐藏层的深度神经网络,采用自适应动量。
  • 使用高斯过程模型的贝叶斯优化方法调优六个超参数:层数、每层隐藏单元数、学习率衰减、初始和最终动量,以及动量饱和的训练轮数。
  • 训练数据由8000万个模拟事件组成,经过归一化处理,对偏度>1.0的特征应用了偏度校正的对数变换。
  • 网络在隐藏层使用修正线性单元(ReLU),输出层使用逻辑单元,采用交叉熵损失函数进行信号(H→τ⁺τ⁻)与背景(Z→τ⁺τ⁻)的二分类。
  • 将该方法与基于低层次变量和物理学家手工构建的高层次特征训练的浅层网络进行了对比。
  • 计算使用Pylearn2和Theano在GPU加速硬件上完成,Spearmint用于贝叶斯优化。

实验结果

研究问题

  • RQ1基于低层次探测器变量训练的深度神经网络是否能在H→τ⁺τ⁻搜索中优于基于高层次、物理学家工程化特征训练的浅层网络?
  • RQ2超参数的贝叶斯优化是否能显著提升希格斯玻色子衰变的发现显著性?
  • RQ3在此高能物理分类任务中,深度网络的最佳深度和架构为何?
  • RQ4深度网络在多大程度上能自动学习到与手工特征中编码的判别信息等效的信息?
  • RQ5在该大数据环境下,正则化技术(如dropout或噪声注入)是否能提升性能?

主要发现

  • 表现最佳的深度网络具有八个隐藏层,每层274个单元,其发现显著性提升等效于数据集规模增加25%。
  • 基于低层次变量训练的深度网络优于基于高层次特征训练的浅层网络,表明其能自动学习到相关判别性模式。
  • 贝叶斯优化算法选择八层为最优,表明更深层次的架构对达到峰值性能是必要的。
  • 表现最佳的浅层网络使用单个隐藏层,包含693个单元,初始学习率为0.006,动量恒定为0.5。
  • 正则化技术如dropout和噪声注入未提升性能,可能是因为训练数据集规模较大,降低了过拟合风险。
  • 发现显著性的提升被量化为等效于25%的数据量增加,表明分析效率有显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。