Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Testing

Peter Grünwald, Rianne de Heide|arXiv (Cornell University)|2019. 06. 18.
Bayesian Modeling and Causal Inference인용 수 12
한 줄 요약

이 논문은 귀무가설 하에서 E[E] ≤ 1을 만족하는 비음수 랜덤 변수인 e-값을 기반으로 한 가설 검정을 위한 새로운 프레임워크를 제안한다. p-값과 달리, e-값은 선택적 계속(옵셔널 컨티뉴이션) 하에서도 제1종 오류 통제를 유지하며, 성장률 최적성(GRO)을 갖는다. GRO e-변수들은 특정 사전분포 하에서 베이즈 요인으로 나타나며, 페일러리안, 네이만-피어슨, 베이지안 접근법을 통합적으로 다룰 수 있는 강건하고 해석 가능한 통계적 추론을 가능하게 한다.

ABSTRACT

We develop the theory of hypothesis testing based on the e-value, a notion of evidence that, unlike the p-value, allows for effortlessly combining results from several studies in the common scenario where the decision to perform a new study may depend on previous outcomes. Tests based on e-values are safe, i.e. they preserve Type-I error guarantees, under such optional continuation. We define growth-rate optimality (GRO) as an analogue of power in an optional continuation context, and we show how to construct GRO e-variables for general testing problems with composite null and alternative, emphasizing models with nuisance parameters. GRO e-values take the form of Bayes factors with special priors. We illustrate the theory using several classic examples including a one-sample safe t-test and the 2 x 2 contingency table. Sharing Fisherian, Neymanian and Jeffreys-Bayesian interpretations, e-values may provide a methodology acceptable to adherents of all three schools.

연구 동기 및 목표

  • 선택적 계속 상황에서 데이터를 추가로 수집할지의 결정이 이전 결과에 의존하는 경우에도 유효한 가설 검정 이론을 개발하는 것.
  • 특히 선택적 계속 하에서 오류 통제가 불가능한 p-값의 한계를 해결하는 것.
  • e-값을 공통 통화로 사용하여 페일러리안, 네이만-피어슨, 제프레즈-베이지안 해석을 통합하는 것.
  • 복합가설과 난이성 매개변수를 포함한 모형에서 e-변수를 일반적으로 구성하고 제1종 오류 통제를 보장하는 방법론을 제공하는 것.
  • 선택적 계속 상황에서의 성장률 최적성(GRO)을 고정표본 검정에서의 검정력과 유사한 의미 있는 기준으로 정의하고, 특정 사전분포나 최소최대 원리로 GRO e-변수를 구성하는 방법을 보여주는 것.

제안 방법

  • 모든 귀무분포 하에서 E[E] ≤ 1을 만족하는 비음수 랜덤 변수로 e-변수를 정의하여 제1종 오류 통제를 보장한다.
  • 임계값 검정을 도입: E ≥ 1/α 이면 H₀를 기각하며, 이는 어떤 선택적 계속 계획 하에서도 유의수준 α에서 제1종 오류를 통제한다.
  • 성장률 최적성(GRO)을 순차적 검정에서의 최적성 기준으로 도입하며, 고정표본 검정에서의 검정력과 유사한 개념이다.
  • 특정 사전분포를 사용한 베이즈 요인을 통해 GRO e-변수를 구성하며, 위치-스케일 가족의 경우 오른쪽 하르 사전분포를 포함한다.
  • 대립가설에 대한 사전분포가 없는 경우를 고려해 GROW(최악의 경우) 및 REGROW(상대적) 최적성 기준을 도입한다.
  • 정보 투영과 지수족 이론을 활용해 난이성 매개변수를 포함한 모형(예: t-검정, 2×2 교차표)에서 e-변수를 유도한다.

실험 결과

연구 질문

  • RQ1선택적 계속 상황에서 데이터 수집 결정이 이전 결과에 의존할 때, 어떻게 가설 검정을 안전하게 유지할 수 있는가?
  • RQ2선택적 계속 상황에서 통계적 검정력의 적절한 대체 기준은 무엇이며, 어떻게 수학적으로 정의할 수 있는가?
  • RQ3e-값을 통해 페일러리안, 네이만-피어슨, 베이지안 접근법의 증거 해석을 통합할 수 있는가?
  • RQ4t-검정이나 2×2 교차표와 같은 복합가설과 난이성 매개변수를 포함한 경우, e-변수는 어떻게 구성할 수 있는가?
  • RQ5e-변수와 베이즈 요인 사이의 관계는 무엇이며, 어떤 조건에서 이 둘이 일치하는가?

주요 결과

  • e-변수들은 p-값과 달리 선택적 계속 하에서도 제1종 오류 통제를 유지하므로, 순차적 및 적응형 검정에 적합하다.
  • 성장률 최적성(GRO)은 순차적 검정에서의 최적성 기준으로 의미 있는 기준으로 입증되었으며, GRO e-변수들은 주어진 대립분포 하에서 가장 빠른 기대 성장률을 달성한다.
  • 일표본 t-검정에서 GRO e-변수는 오른쪽 하르 사전분포를 사용한 베이즈 요인과 일치하며, 객관적 베이지안 방법과 일치한다.
  • 2×2 교차표에서는 GRO e-변수가 표준 베이즈 요인과 일치하지 않으며, 이는 여전히 최적성과 오류 통제를 유지하는 새로운 비베이지안 구성임을 시사한다.
  • e-변수들은 켈리 도박 프레임워크에서의 금전적 이득으로 해석될 수 있어, 귀무가설에 대한 증거의 구체적이고 직관적인 의미를 제공한다.
  • 이 프레임워크는 페일러리안, 네이만-피어슨, 제프레즈-베이지안 접근법을 통합한다: e-값은 특정 대립가설이 필요 없이 증거 해석을 지원하며, 임계값 검정을 통해 의사결정을 지원하고, 베이지안 사전분포로부터 유도될 수 있어 세 접근법을 연결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.