Skip to main content
QUICK REVIEW

[논문 리뷰] Validation of Approximate Likelihood and Emulator Models for Computationally Intensive Simulations

Niccolò Dalmasso, Ann B. Lee|arXiv (Cornell University)|2019. 05. 27.
Gaussian Processes and Bayesian Inference참고 문헌 68인용 수 4
한 줄 요약

이 논문은 계산적으로 비용이 많이 드는 시뮬레이션에서 근사 가능도 및 에뮬레이터 모델을 검증하기 위한 통계적 프레임워크를 제안한다. 분포의 차이를 탐지하고 맞춤형 부족 영역을 특정하기 위해 회귀 기반의 이중표본 검정을 사용한다. 이 방법은 순열 검정을 활용하며, 검정의 검정력과 회귀 모델의 정확도를 연결하여 전반적인 적합도 평가와 매개변수 및 특징 공간에서 국소 진단을 모두 가능하게 한다.

ABSTRACT

Complex phenomena in engineering and the sciences are often modeled with computationally intensive feed-forward simulations for which a tractable analytic likelihood does not exist. In these cases, it is sometimes necessary to estimate an approximate likelihood or fit a fast emulator model for efficient statistical inference; such surrogate models include Gaussian synthetic likelihoods and more recently neural density estimators such as autoregressive models and normalizing flows. To date, however, there is no consistent way of quantifying the quality of such a fit. Here we propose a statistical framework that can distinguish any arbitrary misspecified model from the target likelihood, and that in addition can identify with statistical confidence the regions of parameter as well as feature space where the fit is inadequate. Our validation method applies to settings where simulations are extremely costly and generated in batches or "ensembles" at fixed locations in parameter space. At the heart of our approach is a two-sample test that quantifies the quality of the fit at fixed parameter values, and a global test that assesses goodness-of-fit across simulation parameters. While our general framework can incorporate any test statistic or distance metric, we specifically argue for a new two-sample test that can leverage any regression method to attain high power and provide diagnostics in complex data settings.

연구 동기 및 목표

  • 계산적으로 비용이 많이 드는 시뮬레이션에서 근사 가능도 및 에뮬레이터 모델을 검증하기 위한 일관된 방법의 부족을 해결하기 위해.
  • 진정한 가능도와 잘못 지정된 모델을 통계적으로 확신을 가지고 구분하기 위해.
  • 에뮬레이터의 적합도가 부족한 매개변수 및 특징 공간의 특정 영역을 특정하기 위해.
  • 가우시안 합성 가능도 및 신경 밀도 추정기와 같은 다양한 서rogate 모델에 적용 가능한 일반적 프레임워크를 제공하기 위해.
  • 상대적 성능이 아닌, 모델이 충분히 좋은지 여부를 판단할 수 있는 적합도 검정을 제공하기 위해.

제안 방법

  • 진정한 시뮬레이터 분포와 에뮬레이터 분포를 비교하기 위해 회귀 기반 접근 방식을 사용하는 이중표본 검정을 제안한다.
  • 표본 원천(시뮬레이터 대비 에뮬레이터)을 나타내는 Y로 이중표본 검정을 이진 분류 문제로 재구성한다.
  • 검정 통계량 $ \widehat{\mathcal{T}} = \frac{1}{n}\sum_{i=1}^{n}(\widehat{m}(\mathbf{X}_i) - \widehat{\pi}_1)^2 $ 를 사용한다. 여기서 $ \widehat{m} $ 는 에뮬레이터 분포에 속할 확률을 추정한다.
  • 검정의 유효한 추론을 보장하기 위해 순열 절차를 사용하여 p-값을 계산한다. 이는 비모수적 가정이 필요 없음을 의미한다.
  • 검정의 검정력이 사용된 회귀 추정기의 평균 통합 제곱오차(MISE)와 직접 연결되며, 이는 회귀 모델이 잘 맞을수록 높은 검정력을 의미한다.
  • 특징 공간에서의 국소 적합도를 평가하기 위해 $ |\widehat{m}(\mathbf{x}) - \widehat{\pi}_1| $ 를 분석함으로써 국소 진단을 가능하게 한다.

실험 결과

연구 질문

  • RQ1진정한 가능도가 추정이 어려우며 시뮬레이션이 계산적으로 비용이 많이 드는 상황에서 근사 가능도 또는 에뮬레이터 모델을 일관되게 검증할 수 있는가?
  • RQ2매개변수 및 특징 공간에서 에뮬레이터와 시뮬레이터 분포 간의 차이를 탐지하고 국소화할 수 있는가?
  • RQ3복잡한 데이터 설정에서 높은 검정력을 유지하면서도 전반적인 적합도 수준을 평가할 수 있는 통계적 검정은 무엇인가?
  • RQ4회귀 방법의 선택이 검증 검정의 검정력과 신뢰성에 어떤 영향을 미치는가?
  • RQ5상대적 손실 지표를 넘어서, 충분히 좋은 모델과 향후 개선이 필요한 모델을 구분할 수 있는가?

주요 결과

  • 제안된 회귀 기반 이중표본 검정은 고차원 또는 복잡한 특징 공간에서도 시뮬레이터 출력과 에뮬레이터 출력 간의 분포 차이를 효과적으로 탐지한다.
  • 검정의 검정력은 사용된 회귀 모델의 MISE와 직접 연결되며, 이는 회귀 성능이 높을수록 높은 통계적 검정력을 의미한다.
  • 에뮬레이터 적합도의 국소적 차이점은 $ |\widehat{m}(\mathbf{x}) - \widehat{\pi}_1| $ 의 크기를 통해 특정되며, 이는 특징 공간에서의 부적합 영역을 강조한다.
  • 순열 기반 p-값은 분포 가정이 필요 없어 유효한 추론을 보장하며, 이는 강건성을 향상시킨다.
  • 이 프레임워크는 합성 및 실제 천문학적 데이터 예제 모두에서 모델을 성공적으로 검증하여 실용적 유용성을 입증한다.
  • 절대적 적합도 수준 측정을 제공함으로써 기존 손실 함수(예: KL 발산)보다 우수한 성능을 보이며, 상대적 성능이 아닌 절대적 적합도 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.