[논문 리뷰] Post hoc inference via joint family-wise error rate control
이 논문은 데이터 기반으로 선택된 가설 집합에 대해 어떤 데이터 스노핑 이후에도 유효한 통계적 보장을 제공할 수 있도록, 공동 가족-wise 오류율(JER)을 제어하는 사용자 무관(post hoc) 추론 프레임워크를 제안한다. 단계 내림차순 절차와 의존성 인지 보정을 활용하여, 모든 가능한 기각 집합에서 균일한 I형 오류 통제를 보장하며, 이는 고급 임계값과 닫힌 검정 접근법을 통합된 JER 제어 프레임워크 아래 일반화한다.
We introduce a general methodology for post hoc inference in a large-scale multiple testing framework. The approach is called "user-agnostic" in the sense that the statistical guarantee on the number of correct rejections holds for any set of candidate items selected by the user (after having seen the data). This task is investigated by defining a suitable criterion, named the joint-family-wise-error rate (JER for short). We propose several procedures for controlling the JER, with a special focus on incorporating dependencies while adapting to the unknown quantity of signal (via a step-down approach). We show that our proposed setting incorporates as particular cases a version of the higher criticism as well as the closed testing based approach of Goeman and Solari (2011). Our theoretical statements are supported by numerical experiments.
연구 동기 및 목표
- 대규모 다중 검정에서 선택 편향으로 인해 기존 절차가 실패하는 후선택 추론 문제를 해결하기 위해.
- 사용자가 선택한 가설 집합에 대해 임의의 선택 규칙을 사용하더라도 거짓 양성의 수에 대한 통계적 보장을 제공하기 위해.
- 알 수 없는 신호 크기에 적응하고 검정 통계량 간의 의존성을 고려하기 위해.
- 고급 임계값과 닫힌 검정과 같은 기존 접근법을 공동 가족-wise 오류율(JER) 제어 기반의 통일된 프레임워크 아래 통합하기 위해.
- 모든 가능한 선택 집합 R에 대해 균일한 타당성을 확보하여, 임의의 데이터 스노핑에 대해 강건한 추론을 가능하게 하기 위해.
제안 방법
- 모든 선택 집합 R에서 거짓 양성의 수가 bound V(R)를 초과할 확률을 제어하기 위한 기준으로 공동 가족-wise 오류율(JER)을 도입한다.
- 순서통계량의 분포에 기반해 기각 임계치를 적응적으로 보정하는 단계 내림차순 절차를 제안한다.
- 교환 가능한 순열을 활용한 리샘플링 기반 보정 방법을 통해, JER를 수준 α에서 제어하는 유효한 데이터 기반 경계 λ(α,X,H₀)를 구성한다.
- 영가설 집합 H₀에 조건을 두고 순열 불변성을 활용하여 검정 통계량 간의 의존성을 고려한 유효한 p값 비교를 유도한다.
- 기준 기반 임계치와 p값 순서통계량에서 유도된 경계 V(R)를 사용하는 템플릿 기반 프레임워크를 활용한다.
- Simes 부등식과 순열 대칭성을 활용하여, 임의의 선택 규칙 하에서도 유효한 보수적 경계를 도출한다.
실험 결과
연구 질문
- RQ1임의의 데이터 기반 선택 집합 R에 대해, 선택 규칙에 관계없이 유효한 오류 제어를 보장하는 후선택 추론 절차를 구성할 수 있는가?
- RQ2독립성을 가정하지 않고도 검정 통계량 간의 의존성을 후선택 추론에 통합할 수 있는가?
- RQ3제안된 방법이 고급 임계값과 닫힌 검정과 같은 기존 접근법을 통합된 JER 제어 프레임워크 아래 통합할 수 있는가?
- RQ4모든 가능한 기각 집합에서 균일한 I형 오류 통제를 보장하는 데 최소한의 보정 절차는 무엇인가?
- RQ5단계 내림차순 절차는 알려지지 않은 신호 크기에 어떻게 적응하면서도 강력한 오류 통제를 유지하는가?
주요 결과
- 제안된 방법은 모든 가능한 선택 집합 R에 대해 공동 가족-wise 오류율(JER)을 균일하게 제어하며, P(∀R ⊆ {1,…,m}: |H₀ ∩ R| ≤ V(R)) ≥ 1−α 를 보장한다.
- JER 제어 프레임워크는 고급 임계값 접근법과 Goeman 및 Solari(2011)의 닫힌 검정 절차를 일반화하며, 이들을 특수한 경우로 포함한다.
- 단계 내림차순 절차는 영가설 집합의 p값 순서통계량을 활용해 알려지지 않은 진짜 영가설 수에 적응함으로써 희박한 신호 설정에서 검정력 향상을 이룬다.
- 리샘플링 기반 보정 방법은 순환 가능한 순열 통계량의 성질을 활용하여 임의의 의존성 하에서도 유효성을 확보한다.
- 수치 실험을 통해 방법의 유효성을 확인하고, 복잡한 선택 규칙이 존재하는 고차원 설정에서의 실용적 유용성을 입증한다.
- 선택 규칙이 임의적이거나 적응적일 경우에도 방법은 유효하므로 탐색적 데이터 분석에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.