Skip to main content
QUICK REVIEW

[論文レビュー] Machine learning and multivariate goodness of fit

Constantin Weißer, M. Williams|arXiv (Cornell University)|Dec 20, 2016
Nuclear Physics and Applications参考文献 1被引用数 6
ひとこと要約

本論文では、機械学習(ML)分類器を用いて、高次元の多変量適合度検定および2標本検定問題を1次元の問題に簡略化することを提案している。これにより、カイ二乗検定やコルモゴロフ=スミルノフ検定といった標準的な検定が適用可能になる。実証的に、特徴工学が非現実的である場合、特に次元数d > 3の高次元領域において、MLベースの手法が従来のカイ二乗検定を著しく上回ることを示している。一方、情報量の多い低次元特徴(例えば不変質量)を構築可能な場合には、従来手法も依然として有効である。

ABSTRACT

Multivariate goodness-of-fit and two-sample tests are important components of many nuclear and particle physics analyses. While a variety of powerful methods are available if the dimensionality of the feature space is small, such tests rapidly lose power as the dimensionality increases and the data inevitably become sparse. Machine learning classifiers are powerful tools capable of reducing highly multivariate problems into univariate ones, on which commonly used tests such as $χ^2$ or Kolmogorov-Smirnov may be applied. We explore applying both traditional and machine-learning-based tests to several example problems, and study how the power of each approach depends on the dimensionality. A pedagogical discussion is provided on which types of problems are best suited to using traditional versus machine-learning-based tests, and on the how to properly employ the machine-learning-based approach.

研究の動機と目的

  • 次元数の増加に伴い、次元の呪いの影響で従来の多変量適合度検定および2標本検定の検出力が著しく低下する問題に対処すること。
  • 多変量問題を1次元問題に還元する機械学習ベースのアプローチを導入・検証し、カイ二乗検定やコルモゴロフ=スミルノフ検定といったよく理解された検定の適用を可能にすること。
  • 核物理学および素粒子物理学の分析において、MLベースの検定を適切に適用する際の時期と方法を明確に、教育的かつ分かりやすく解説すること。
  • さまざまな次元数と問題タイプにおいて、MLベースの手法と従来の適応的ビン分割カイ二乗検定の統計的検出力の比較を行うこと。
  • 単純な低次元特徴(例:不変質量)がすべての関連情報を捉えきれない高次元設定において、ML手法が優れていることを実証すること。

提案手法

  • 2つのデータサンプル間、またはデータとテスト確率密度関数(PDF)間を区別できる機械学習分類器(例:ランダムフォレスト、XGBoost)を訓練する。
  • 分類器の出力スコア(例:信号クラスに属する確率)を1次元の検定統計量として用いる。
  • 分類器出力分布に対して、標準的な1次元適合度検定(例:カイ二乗検定やコルモゴロフ=スミルノフ検定)を適用し、p値を計算する。
  • さまざまな次元数と信号強度において、帰無仮説からの逸脱を検出できる能力を比較することで、各手法の統計的検出力を評価する。
  • データ生成段階にシステムティック不確実性を組み込む、または交差検証技術を用いることで、トレーニングおよび評価プロセスにシステムティック不確実性を統合する。
  • 例題を用いた性能比較:1次元の周期的モデル、高次元の多変量正規分布、および8次元運動量特徴を持つ現実的な粒子崩壊問題。

実験結果

リサーチクエスチョン

  • RQ1次元数が増加するに従い、MLベースの適合度検定の統計的検出力は、従来の適応的ビン分割カイ二乗検定と比べてどの程度異なるか?
  • RQ2どのような種類の多変量問題において、MLベースのアプローチが従来手法を上回るか?
  • RQ3単純な低次元特徴(例:不変質量)が信号を捉えきれない高次元データにおいて、MLベースの手法が逸脱を効果的に検出できるか?
  • RQ4物理学的分析におけるMLベースの適合度検定に、システムティック不確実性を適切に統合するにはどうすればよいか?
  • RQ5人為的特徴工学(例:不変質量の使用)が、エンドツーエンドのMLベースのアプローチを上回る条件は何か?

主な発見

  • 次元数d ≤ 3の範囲では、適応的ビン分割カイ二乗検定とMLベースの手法の検出力は同等である。
  • d > 3の範囲では、次元の呪いの影響により従来手法に劣るため、MLベースの手法が著しく優れている。
  • 8次元運動量特徴を持つ粒子崩壊の例では、不変質量分布に対する1次元カイ二乗検定が、全8次元空間で訓練されたMLベースの手法を上回っている。これは、熟練した特徴工学の強力さを示している。
  • このような情報量の多い低次元特徴が存在しない場合には、MLベースの手法が従来手法を上回ると予想される。
  • 従来の検定が検出力を失う高次元問題において、MLベースのアプローチは、検出力に優れ、実用的かつ頑健である。特に、検出器応答特徴を含めた場合に顕著である。
  • 本研究は、特徴の低次元化が容易でない高次元で複雑な物理学的問題において、MLベースの検定が従来手法の代替として実用的かつしばしば優れていることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。