Skip to main content
QUICK REVIEW

[論文レビュー] The statistical significance filter leads to overconfident expectations of replicability

Shravan Vasishth, Andrew Gelman|arXiv (Cornell University)|Feb 2, 2017
Statistical Methods and Inference参考文献 17被引用数 6
ひとこと要約

この論文は、p < 0.05 のみを採択する統計的有意性フィルターが、低パワーの研究における効果量の誇張によって、再現可能性の期待が系統的に高められることを示している。解析的導出と心理言語学の事例研究を通じて、有意な結果からのp値が、真のパワーが低い場合に過剰に高められたパワー推定値をもたらし、形式的なパワー分析がなくても、再現性の強固さの誤った錯覚を生じることを明らかにしている。

ABSTRACT

We show that publishing results using the statistical significance filter---publishing only when the p-value is less than 0.05---leads to a vicious cycle of overoptimistic expectation of the replicability of results. First, we show analytically that when true statistical power is relatively low, computing power based on statistically significant results will lead to overestimates of power. Then, we present a case study using 10 experimental comparisons drawn from a recently published meta-analysis in psycholinguistics (J\\"ager et al., 2017). We show that the statistically significant results yield an illusion of replicability. This illusion holds even if the researcher doesn't conduct any formal power analysis but just uses statistical significance to informally assess robustness (i.e., replicability) of results.

研究の動機と目的

  • 統計的有意性(p < 0.05)の結果のみを出版する慣行が、研究者が再現可能性をどの程度歪めているかを調査すること。
  • 真の統計的パワーが低い場合に、有意な結果から得られるパワー推定値が系統的に上方にバイアスされることの解析的証明。
  • 心理言語学分野における事例研究を通じて、小標本からの有意な結果が、形式的なパワー分析がなくても再現性の錯覚を生じることを示すこと。
  • 低いp値がより高い再現可能性を示すという一般的な仮定を疑問視し、この誤解が有意性フィルターに起因することを示すこと。
  • p < 0.05に基づく統計的パワーの概念を放棄し、分野固有の効果量の範囲を研究設計に組み込むべきであることを提唱すること。

提案手法

  • 帰無仮説下でのp値の標本分布を導出し、それが一様分布(0,1)に従うことを示している。
  • 非心t分布を用いて対立仮説下でのt統計量の標本分布をモデル化し、パワー推定を可能にしている。
  • 観察されたt統計量からパワー推定を行うための式を適用:G_{zp}(α) = 1 − Φ(z_α − z_p),ここでz_pは観察されたzスコアである。
  • 観察されたp値と推定パワーの関係を分析し、高いt統計量が真のパワーが低い場合でも高い推定パワーをもたらすことを示している。
  • Jägerら(2017)の心理言語学メタアナリシスから10件の実験的比較を対象に、実データにおける再現性の錯覚を示す事例研究を実施している。
  • シミュレーションと解析的モデリングを用いて、有意な結果からの効果量推定値が系統的に過大評価されること(タイプM誤差)を示している。特に、低パワー設計において顕著である。

実験結果

リサーチクエスチョン

  • RQ1統計的有意性フィルターは、真のパワーが低い場合に、出版された研究における再現可能性への過信の期待をどのように高めているか?
  • RQ2真のパワーが低い場合に、有意な結果からのp値が、真の統計的パワーをどの程度過大に推定しているか?
  • RQ3統計的有意性にのみ依存する非形式的なアプローチが、実験結果における誤った強固さと再現性の認識を生じさせる可能性があるか?
  • RQ4元のp値の大きさと成功した再現の確率の関係は何か?この関係は誤解を招くものか?
  • RQ5心理学者や神経科学者などの分野における効果量の誇張(タイプM誤差)は、研究設計と再現性にどのような影響を及えるか?

主な発見

  • 真のパワーが低い場合、有意性フィルターは、標本分布の上尾部から有意な結果が抽出されるため、効果量推定値が高められ、パワーの過剰推定を引き起こす。
  • 有意な結果からの観察されたt統計量は、t値が高くなるほど、パワー推定値が単調増加する関数として得られ、真のパワーが低い場合でも高い再現可能性の誤った印象を与える。
  • 心理言語学の事例研究では、p < 0.05の10件の発表済み比較において、効果量が誇張され、パワーが過剰に推定されており、標本サイズが小さい(n = 20–40)にもかかわらず再現性の錯覚が生じていた。
  • オープンサイエンスコラボラトリーの報告では、元のp値と再現成功の相関が、低いp値がより良い再現性を予測すると解釈されているが、実際には同じバイアスを反映している。
  • 多くの心理学および神経科学の研究は低パワーである(例:神経科学分野では8–31%、行動科学分野では平均24%)、しかし研究者は有意性フィルターの影響で再現性に過信を寄せ続けている。
  • 発表済み結果に基づく形式的なパワー分析は、同じバイアスを含む有意効果推定値に基づくため、真のパワーを系統的に過大に推定してしまう。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。