Skip to main content
QUICK REVIEW

[論文レビュー] Safe Testing

Peter Grünwald, Rianne de Heide|arXiv (Cornell University)|Jun 18, 2019
Bayesian Modeling and Causal Inference被引用数 12
ひとこと要約

この論文は、帰無仮説の下で E[E] ≤ 1 を満たす非負の確率変数である e-値に基づく、新しい仮説検定フレームワークを導入する。p-値とは異なり、e-値は任意継続(optional continuation)の下でも第1種誤りを制御でき、成長率最適性(GRO)を示す。GRO である e-変数は特定の事前分布の下でベイズ因子として現れ、フィッシャー的、ネイマン=ピアソン的、ベイジアンな枠組みを統合的に扱える、強固で解釈可能で一貫性のある推論を可能にする。

ABSTRACT

We develop the theory of hypothesis testing based on the e-value, a notion of evidence that, unlike the p-value, allows for effortlessly combining results from several studies in the common scenario where the decision to perform a new study may depend on previous outcomes. Tests based on e-values are safe, i.e. they preserve Type-I error guarantees, under such optional continuation. We define growth-rate optimality (GRO) as an analogue of power in an optional continuation context, and we show how to construct GRO e-variables for general testing problems with composite null and alternative, emphasizing models with nuisance parameters. GRO e-values take the form of Bayes factors with special priors. We illustrate the theory using several classic examples including a one-sample safe t-test and the 2 x 2 contingency table. Sharing Fisherian, Neymanian and Jeffreys-Bayesian interpretations, e-values may provide a methodology acceptable to adherents of all three schools.

研究の動機と目的

  • 任意継続(過去の結果に応じて追加データ収集を決定する)の下でも有効な仮説検定理論の構築。
  • 特に任意継続下での誤り制御の欠如により、p-値が有効でない逐次的・適応的検定状況における限界の解消。
  • e-値を共通の通貨として用いることで、フィッシャー的、ネイマン=ピアソン的、ジェフレーズ=ベイジアン的証拠解釈の統合。
  • 複合仮説およびねんびパラメータを含むモデルにおける e-変数の一般的構築法の提供、第1種誤りの制御を保証。
  • 任意継続の文脈におけるパワーの意味的な類似物としての成長率最適性(GRO)の確立、および特定の事前分布やミニマックス原理を用いた GRO e-変数の構成法の示唆。

提案手法

  • e-変数を、すべての帰無分布の下で E[E] ≤ 1 を満たす非負の確率変数として定義し、第1種誤りの制御を保証。
  • しきい値検定を導入:E ≥ 1/α ならば H₀ を棄却することで、任意の任意継続スキーム下で有意水準 α での第1種誤り制御を達成。
  • 逐次的検定における最適性基準として、固定標本サイズ検定におけるパワーに類似した成長率最適性(GRO)を提唱。
  • 特定の代替仮説における事前分布を用いたベイズ因子により GRO e-変数を構成。特に、位置スケール族では右ハール事前分布を用いる。
  • 代替仮説に事前分布がない場合の拡張として、GROW(最悪ケース)および REGROW(相対的)最適性基準を導入。
  • 情報射影および指数型分布族理論を用いて、t検定や 2×2 クロス集計表などのねんびパラメータを含むモデルにおける e-変数を導出。

実験結果

リサーチクエスチョン

  • RQ1過去の結果に依存して追加データ収集を決定する任意継続の下で、仮説検定をどのように安全に保てるか?
  • RQ2任意継続の文脈における統計的パワーの適切な類似物とは何か? そして、どのように形式化できるか?
  • RQ3e-値は、フィッシャー的、ネイマン=ピアソン的、ベイジアン的アプローチの証拠解釈を統合できるか?
  • RQ4t検定や 2×2 クロス集計表のような、ねんびパラメータを含む複合仮説における e-変数は、どのように構成できるか?
  • RQ5e-変数とベイズ因子の関係は何か? どのような条件下で一致するか?

主な発見

  • e-変数は、p-値とは異なり、任意継続の下でも第1種誤りを制御する。これにより、逐次的・適応的検定に適している。
  • 成長率最適性(GRO)は、逐次的検定における最適性の意味的基準として確立され、GRO e-変数は与えられた代替分布の下で最も速い期待成長率を達成する。
  • 一標本 t 検定では、GRO e-変数は右ハール事前分布を用いたベイズ因子に一致し、客観的ベイジアン手法と整合する。
  • 2×2 クロス集計表では、GRO e-変数は標準的なベイズ因子に対応しないが、新規の非ベイジアン構成でありながら、最適性と誤り制御を維持している。
  • e-変数はケリー・ギャンブル枠組みにおける資金の増加として解釈可能で、帰無仮説に対する証拠の明確で直感的な解釈を提供する。
  • このフレームワークは、フィッシャー的、ネイマン=ピアソン的、ジェフレーズ=ベイジアン的アプローチを統合する:e-値は特定の代替仮説を必要とせず証拠を解釈可能であり、しきい値検定により意思決定を支援し、ベイジアン事前分布から導出可能であるため、三つの枠組みを橋渡しする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。