Skip to main content
QUICK REVIEW

[論文レビュー] Multiple testing when many $p$-values are uniformly conservative, with application to testing qualitative interaction in educational interventions

Qingyuan Zhao, Dylan S. Small|arXiv (Cornell University)|Mar 28, 2017
Advanced Causal Inference Techniques参考文献 4被引用数 6
ひとこと要約

本稿では、多数のp値が一様に保守的である状況下で、教育的および医療的介入における質的相互作用を検出するための、条件付きに基づく多重仮説検定手法を提案する。古典的手法に比べて検出力が著しく向上する。この手法は、片側検定および正規分布母数スケールモデルにおける一様な保守的性質を活用し、閾値τを条件付けの対象として適応的に選択する。理論的およびシミュレーション的裏付けにより、保守的性質が存在する場合には著しい検出力の向上が得られ、そうでない場合には最小限の第一種過誤の増加に抑えられることが示された。

ABSTRACT

In the evaluation of treatment effects, it is of major policy interest to know if the treatment is beneficial for some and harmful for others, a phenomenon known as qualitative interaction. We formulate this question as a multiple testing problem with many conservative null $p$-values, in which the classical multiple testing methods may lose power substantially. We propose a simple technique---conditioning---to improve the power. A crucial assumption we need is uniform conservativeness, meaning for any conservative $p$-value $p$, the conditional distribution $(p/τ)\,|\,p \le τ$ is stochastically larger than the uniform distribution on $(0,1)$ for any $τ$. We show this property holds for one-sided tests in a one-dimensional exponential family (e.g.\ testing for qualitative interaction) as well as testing $|μ|\leη$ using a statistic $X \sim \mathrm{N}(μ,1)$ (e.g.\ testing for practical importance with threshold $η$). We propose an adaptive method to select the threshold $τ$. Our theoretical and simulation results suggest the proposed tests gain significant power when many $p$-values are uniformly conservative and lose little power when no $p$-value is uniformly conservative. We apply our method to two educational intervention datasets.

研究の動機と目的

  • 多数の保守的p値を伴うマルチサイトまたはメタアナリシス研究において、治療効果が一部のサブグループでは有益で、他のサブグループでは有害であるという質的相互作用を検出する課題に対処すること。
  • サブグループ分析やマルチサイト分析において一般的に見られるように、p値が一様に保守的である場合に、古典的手法が検出力を失う問題を克服すること。
  • 保守的性質の度合いに応じて、最適な閾値τを条件付けの対象として適応的に選択する手法を開発すること。
  • p値が一様に保守的である場合には高い検出力を維持し、そうでない場合には第一種過誤の増加を最小限に抑えること。
  • 実際の教育介入データセットにこの手法を適用し、変更された学校カリキュラムやライティング・トゥ・ラーニングプログラムにおける質的相互作用を評価すること。

提案手法

  • 帰無仮説下でのp値の一様な保守的性質を活用することで、検出力を向上させる条件付きに基づく多重仮説検定手順を提案する。
  • 一様な保守的性質を、任意のτに対して条件付き分布(p/τ | p ≤ τ)がUniform(0,1)よりも確率的に大きいこととして定義する。これは指数型分布族における片側検定および閾値を伴う正規母平均検定で成立する。
  • p値の保守的性質の仮定の下で検出力を最適化するため、経験ベイズ法またはプラグイン法を用いてデータに適応した閾値τを選択する。
  • 質的相互作用を検出するため、global null仮説H₀ = H₀⁺ ∪ H₀⁻(H₀⁺はすべての効果が非負、H₀⁻はすべての効果が非正)を検定に用いる。
  • 極値理論およびガウス過程近似を用いて、相関のある正規変数の最大値に関するテスト統計量の漸近的性質を導出する。
  • 理論的保証として、本手法が家族ワイズ誤り率を制御し、p値が一様に保守的である場合にはボンフェローニやボンフェローニ=ホルム、またはベイジアン・ホルムのような古典的手法よりも高い検出力を達成することを示す。

実験結果

リサーチクエスチョン

  • RQ1多数のp値が一様に保守的である状況下で、特に質的相互作用の検出において、多重仮説検定手順の検出力を向上させることは可能か?
  • RQ2データに適応した閾値τを条件付けに用いることで、一様な保守的性質がある場合に、古典的手法よりも検出力の高い検定が得られるか?
  • RQ3本手法はどのような条件下で、高い検出力を維持するとともに第一種過誤の制御を保つことができるか?
  • RQ4実世界の教育介入データセット(質的相互作用の可能性を有する)において、本手法はどのように性能を発揮するか?
  • RQ5指数型分布族における片側検定や閾値付き正規母平均検定といった一般的な設定において、一様な保守的性質の仮定は妥当か?

主な発見

  • 提案された条件付き手法は、p値が一様に保守的である場合には、特にマルチサイトまたはメタアナリシス研究における質的相互作用の検出において顕著な検出力の向上を達成する。
  • p値が一様に保守的でない場合には、第一種過誤が低く抑えられ、検出力の損失も最小限に抑えられ、あらゆる状況にわたるロバストネスを示す。
  • 理論的分析により、一様な保守的性質が成立する場合、テスト統計量p_min × n_c / c が確率的に発散することを示し、これにより家族ワイズ誤り率が強く制御されることを裏付ける。
  • シミュレーションおよび実データ応用(変更された学校カリキュラムやライティング・トゥ・ラーニング介入)により、本手法の実用的有用性と有害サブグループの改善された検出能力が示された。
  • サブグループ数nが大きい場合に特に有効であり、保守的性質がある場合、検出力はn^ε / √log n(ε > 0)の割合で増加する。
  • 特に質的相互作用が存在する状況において、ボンフェローニやベイジアン・ホルムなどの標準的手法よりも、本手法は優れた性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。