[论文解读] Anomalies, Representations, and Self-Supervision
该论文提出 AnomalyCLR,一种用于高能物理中模型无关异常检测的自监督对比学习方法,通过使用异常增强的背景数据,利用排列不变的 Transformer 编码器学习鲁棒且不变的表征。在 CMS ADC2021 数据集的多个基准信号中,该方法在 30% 信号效率下相较原始数据基线实现了 14–70% 的显著性提升。
We develop a self-supervised method for density-based anomaly detection using contrastive learning, and test it using event-level anomaly data from CMS ADC2021. The AnomalyCLR technique is data-driven and uses augmentations of the background data to mimic non-Standard-Model events in a model-agnostic way. It uses a permutation-invariant Transformer Encoder architecture to map the objects measured in a collider event to the representation space, where the data augmentations define a representation space which is sensitive to potential anomalous features. An AutoEncoder trained on background representations then computes anomaly scores for a variety of signals in the representation space. With AnomalyCLR we find significant improvements on performance metrics for all signals when compared to the raw data baseline.
研究动机与目标
- 解决大型强子对撞机(LHC)上模型无关的新物理搜索挑战,传统假设驱动的方法可能遗漏出乎意料的信号。
- 克服现有基于密度的异常检测方法的局限性,这些方法对坐标系选择敏感,且在数据重参数化下缺乏不变性。
- 开发一种表征学习框架,对物理对称性保持不变,同时对通用异常特征敏感,且无需真实标签或信号特定先验。
- 通过构建模拟非标准模型物理的伪标签数据增强,利用自监督方法提升异常检测性能,从而学习到对潜在异常敏感的表征。
- 通过在预训练的自编码器上计算异常得分,展示异常增强对比学习在学习用于下游异常评分的鲁棒、判别性表征方面的有效性。
提出的方法
- 提出一种使用异常增强数据作为正样本对的自监督对比学习框架,其中数据增强被设计为模拟背景数据中的通用异常特征。
- 使用排列不变的 Transformer 编码器将对撞机事件(如粒子喷注或物体)映射到高维表征空间,保持对物体顺序的不变性。
- 定义一种新颖的对比损失函数,促使模型将原始事件与其增强版本映射得更近,同时与其它背景事件保持更远距离。
- 仅在背景数据上端到端训练模型,利用异常增强作为伪监督形式,学习对潜在异常敏感的表征。
- 在学习到的表征上应用预训练的自编码器以计算异常得分,其中重建误差作为异常度量指标。
- 通过调整表征维度和自编码器架构的超参数来优化表征空间,评估在不同信号模型和效率下的性能表现。

实验结果
研究问题
- RQ1使用异常增强数据的自监督对比学习是否能提升高能物理中基于密度的异常检测性能?
- RQ2表征维度的选择如何影响不同信号模型下的异常检测显著性?
- RQ3与标准数据增强相比,使用异常增强在表征学习中能在多大程度上提升鲁棒性和不变性?
- RQ4AnomalyCLR 框架是否在多样化的信号模型下,相较原始数据基线在显著性和误差降低方面表现更优?
- RQ5该方法是否能在无需信号特定调优或真实标签的情况下,泛化到不同类型的信号?
主要发现
- 在 CMS ADC2021 数据集的全部四个基准信号中,AnomalyCLR 在固定 30% 信号效率下相较原始数据基线实现了 14–70% 的显著性提升。
- 该方法在所有信号上均表现出一致的性能增益,证明了其模型无关性以及对多样化异常拓扑的鲁棒性。
- 随着表征维度的增加,异常检测性能显著提升,大多数信号的峰值出现在 120 至 200 维之间,而 h+ 信号的性能在 400 维时仍持续提升。
- 随着表征维度的增加,显著性提升的相对误差减小,表明在更高维度下性能更加稳定可靠。
- 使用异常增强使得表征空间更具不变性和判别性,降低了对坐标系重参数化的敏感度。
- 该方法优于原始数据上的标准自编码器基线,证明了基于物理动机增强的自监督预训练具有实际价值。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。