Skip to main content
QUICK REVIEW

[论文解读] Machine learning and multivariate goodness of fit

Constantin Weißer, M. Williams|arXiv (Cornell University)|Dec 20, 2016
Nuclear Physics and Applications参考文献 1被引用 6
一句话总结

本文提出使用机器学习(ML)分类器将高维多变量拟合优度检验和两样本检验问题简化为单变量问题,从而可应用卡方检验或柯尔莫哥洛夫-斯米尔诺夫检验等标准检验方法。结果表明,在高维情形(d > 3)下,尤其当特征工程不可行时,基于ML的方法显著优于传统卡方检验;而当可构建有信息量的低维特征(如不变质量)时,传统方法仍具有效力。

ABSTRACT

Multivariate goodness-of-fit and two-sample tests are important components of many nuclear and particle physics analyses. While a variety of powerful methods are available if the dimensionality of the feature space is small, such tests rapidly lose power as the dimensionality increases and the data inevitably become sparse. Machine learning classifiers are powerful tools capable of reducing highly multivariate problems into univariate ones, on which commonly used tests such as $χ^2$ or Kolmogorov-Smirnov may be applied. We explore applying both traditional and machine-learning-based tests to several example problems, and study how the power of each approach depends on the dimensionality. A pedagogical discussion is provided on which types of problems are best suited to using traditional versus machine-learning-based tests, and on the how to properly employ the machine-learning-based approach.

研究动机与目标

  • 解决由于维度灾难导致的传统多变量拟合优度检验与两样本检验统计功效随维度增加而下降的问题。
  • 提出并验证一种基于机器学习的方法,将多变量问题简化为单变量问题,从而可应用如卡方检验或柯尔莫哥洛夫-斯米尔诺夫检验等成熟标准检验方法。
  • 为核物理与粒子物理分析中的物理学家提供清晰、教学性的指南,说明在何种情况下以及如何正确应用基于ML的检验方法。
  • 在不同维度水平和问题类型下,比较基于ML的方法与传统自适应分箱卡方检验的统计功效。
  • 证明当无法通过简单低维特征完全捕捉所有相关信息时,基于ML的方法在高维场景下更具优势。

提出的方法

  • 训练一个机器学习分类器(如随机森林、XGBoost)以区分两组数据样本,或区分数据与一个测试概率密度函数(PDF)。
  • 将分类器的输出得分(如属于信号类的概率)作为单变量检验统计量。
  • 对分类器输出分布应用标准单变量拟合优度检验(如卡方检验或柯尔莫哥洛夫-斯米尔诺夫检验)以计算p值。
  • 通过比较各方法在不同维度和信号强度下检测原假设偏离的能力,评估统计功效。
  • 通过在数据生成过程中引入系统不确定性,或使用交叉验证技术,将系统不确定性纳入训练与评估过程。
  • 通过典型问题对比性能:一维振荡模型、高维多变量正态分布,以及一个包含8维运动学特征的真实粒子衰变问题。

实验结果

研究问题

  • RQ1随着维度增加,基于ML的拟合优度检验与传统自适应分箱卡方检验的统计功效如何比较?
  • RQ2在哪些类型的多变量问题中,基于ML的方法优于传统方法?
  • RQ3当无简单低维特征(如不变质量)能捕捉信号时,基于ML的方法是否能有效检测高维数据中的偏离?
  • RQ4在物理分析中,应如何正确地将系统不确定性整合到基于ML的拟合优度检验中?
  • RQ5在何种条件下,人工主导的特征工程(如使用不变质量)仍优于端到端的基于ML的方法?

主要发现

  • 当维度 d ≤ 3 时,自适应分箱卡方检验与基于ML的方法统计功效相近。
  • 当 d > 3 时,由于维度灾难对传统方法的影响,基于ML的方法显著优于自适应分箱卡方检验。
  • 在包含8维运动学特征的粒子衰变实例中,基于不变质量分布的一维卡方检验优于在完整8维空间上训练的基于ML的方法,凸显了专家驱动特征工程的强大优势。
  • 当不存在此类有信息量的低维特征时,基于ML的方法预计比传统方法更具统计功效。
  • 当传统检验因维度增加而失效时,基于ML的方法在高维问题中表现出鲁棒性与实用性,尤其在包含探测器响应特征时更为显著。
  • 本研究证实,在特征降维不直接可行的高维复杂物理问题中,基于ML的检验是一种可行且通常更优的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。