[논문 리뷰] Learning the EFT likelihood with tree boosting
이 논문은 LHC에서 다중 매개변수 측정 분석에서 효과적 장이론(EFT) 분석의 가능도 비율을 학습하기 위해 트리 부스팅 알고리즘인 Boosted Information Trees(BIT)를 소개한다. 시뮬레이션된 이벤트 데이터와 함께 이벤트별 정보를 사용하여 훈련함으로써, BIT는 윌슨 계수수에 대해 순서별로 미분 단면적 비율을 근사하며, 가능도 비율 검정과 유사한 거의 최적의 통계적 능력을 달성한다. 이는 기본적인 $p_{\textrm{T,Z}}$-기반 방법에 비해 배제 감도에서 뚜렷한 향상을 보인다.
We develop a tree boosting algorithm for collider measurements of multiple Wilson coefficients in effective field theories describing phenomena beyond the standard model of particle physics. The design of the discriminant exploits per-event information of the simulated data sets that encodes the predictions for different values of the Wilson coefficients. This ``Boosted Information Tree'' algorithm provides nearly optimal discrimination power order-by-order in the expansion in the Wilson coefficients and approaches the optimal likelihood ratio test statistic. As a proof-of-principle, we apply the algorithm to the $ extrm{pp} ightarrow extrm{Zh}$ process for different types of modeling.
연구 동기 및 목표
- 스마트 모델-효과 장이론(SM-EFT)에서 다중 윌슨 계수수를 측정하기 위한 통계적으로 최적이고 확장 가능한 방법을 개발한다.
- 글로벌 EFT 피팅에서 고차원적 특징 공간과 복잡한 매개변수 공간의 과제를 해결한다.
- 트리 기반의 회귀를 사용하여 순서별로 미분 단면적 비율을 효율적으로 추정한다.
- 실제 시뮬레이션 환경에서 기존의 $p_{\textrm{T,Z}}$-기반 전략에 비해 향상된 배제 감도를 보여준다.
- 이벤트별 시뮬레이션 데이터를 활용하여 진정한 검출기 수준 가능도를 근사하는 모델을 훈련하는 프레임워크를 구축한다.
제안 방법
- 이 방법은 이벤트 특징 $\boldsymbol{x}$ 에 대한 함수로, 미분 단면적 비율 $\hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$ 에 대해 트리 부스팅을 사용하여 평균 제곱오차(MSE) 손실 기능을 최소화한다.
- 이것은 $\boldsymbol{\theta}_0$ 를 중심으로 하여 단면적 비율을 테일러 급수로 전개하며, 각 차수는 별도의 부스팅 트리 회귀기로 추정된다.
- 약한 학습기는 CART 의사결정 트리이며, 표준 모델-EFT 의존성에 따라 가중된 시뮬레이션 이벤트를 사용하여 계수 함수를 인코딩한다.
- 부스팅 알고리즘은 훈련 데이터에서 MSE 손실을 최소화함으로써 $\hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$ 의 추정치를 순차적으로 향상시킨다.
- 최종 테스트 통계량 $\hat{q}(\mathcal{D}) = -\log \hat{R}(\boldsymbol{x}|\boldsymbol{\theta}, \boldsymbol{\theta}_0)$ 은 가설 검정과 배제 한계를 위해 사용된다.
- 고차항 EFT 항이 불확실한 경우에도 최적성을 유지하기 위해, 훈련과 관심 있는 계수수를 분리하는 방식의 구간화된 추정기 버전이 도입된다.
실험 결과
연구 질문
- RQ1트리 부스팅을 사용하여 다중 매개변수 EFT 측정에서 거의 최적의 통계적 능력을 갖춘 가능도 비율을 학습할 수 있는가?
- RQ2실제 LHC 시뮬레이션 조건 하에서 Boosted Information Tree(BIT) 방법이 진정한 가능도 비율을 얼마나 잘 근사하는가?
- RQ3BIT는 윌슨 계수수의 배제 감도 측면에서 기존의 $p_{\textrm{T,Z}}$-기반 분석 전략보다 뛰어나게 성능을 발휘하는가?
- RQ4윌슨 계수수 전개의 고차항이 무시되거나 불확실한 경우, 이 방법이 얼마나 최적성을 유지하는가?
- RQ5BIT 프레임워크는 배경과 검출기 효과를 포함한 실제 이벤트 생성기에 적용될 수 있는가?
주요 결과
- BIT 방법은 가설 검정에서 거의 최적의 분류 능력을 달성하며, 네이만-피어슨 정리에 따르면 진정한 가능도 비율 검정 통계량과 유사한 성능을 보인다.
- pp \to \mathrm{Z}h 과정의 토이 모델에서 BIT 기반의 테스트 통계량은 최적의 검정 능력과 정확한 배제 윤곽을 보이며, 이론적 최적성의 타당성을 입증한다.
- 배경을 포함한 실제 MadGraph5_aMC@NLO 시뮬레이션 환경에서, BIT는 신경망 분류기를 사용한 $p_{\textrm{T,Z}}$-기반 전략에 비해 뚜렷한 배제 감도 향상을 보였다.
- BIT 추정기의 구간화된 버전은 고차항 EFT 항이 불확실한 경우에도 최적의 성능을 유지한다. 이는 훈련과 관심 있는 계수수를 분리함으로써 달성된다.
- 이 방법은 간단하고 해석 가능한 분석 통계량을 제공하며, 이는 구간화된 및 비구간화된 가설 검정을 모두 가능하게 한다.
- 알고리즘은 윌슨 계수수의 수에 따라 효율적으로 스케일링되며, EFT 전개의 차수만큼의 회귀기만 필요로 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.