Skip to main content
QUICK REVIEW

[論文レビュー] The illusion of power: How the statistical significance filter leads to overconfident expectations of replicability

Shravan Vasishth, Andrew Gelman|arXiv (Cornell University)|Feb 2, 2017
Social and Intergroup Psychology被引用数 7
ひとこと要約

この論文は、p < 0.05 という統計的有意水準にのみ基づく結果の公表という一般的な慣習が、真の統計的パワーが低い場合でも、高い再現性があるかのような誤った認識を生み出していることを示している。有意な結果のみからパワーを推定することで、研究者は再現性を過大評価し、心理学者や心理言語学研究において過剰な自信を持つことになる。

ABSTRACT

We show that publishing results using the statistical significance filter---publishing only when the p-value is less than 0.05---leads to a vicious cycle of overoptimistic expectation of the replicability of results. First, we show through a simple derivation that when true statistical power is relatively low, computing power based on statistically significant results will lead to overestimates of power. Then, we present a case study using 10 experimental comparisons drawn from a recently published meta-analysis in psycholinguistics (J\ager et al., 2017). We show that the statistically significant results yield an illusion of replicability, i.e., an illusion that power is high. This illusion holds even if the researcher doesn't conduct any formal power analysis but just uses statistical significance to informally assess robustness of results.

研究の動機と目的

  • 統計的有意水準(p < 0.05)にのみ基づく結果の公表という慣習が、再現性の期待値にどのように歪みをもたらすかを調査すること。
  • 真のパワーが低い状況下で、有意な結果から算出されるパワーが、真のパワーを系統的に過大評価することを示すこと。
  • 形式的なパワー分析を行わずに、p値に依存するだけでも、再現性の錯覚が生じることを明らかにすること。
  • この過大評価が、心理学および心理言語学分野における科学的知見の信頼性と再現可能性に与える影響を強調すること。

提案手法

  • 真のパワーが低い状況下で、観察されたp値と推定された統計的パワーとの間の数学的関係を導出すること。
  • 導出された式を用いて、事例研究として有意な結果からパワー推定値を算出すること。
  • 心理言語学分野のメタアナリシス(Jäger et al., 2017)に掲載された10件の実験的比較結果を、パワー推定の実証的入力として用いること。
  • 元の研究における効果量とサンプルサイズから算出される真のパワーと、有意な結果から推定されたパワーを比較すること。
  • 真のパワーが低い場合、p < 0.05 の結果に基づくパワー推定値が一貫して高めに評価されることを示すこと。
  • 形式的パワー分析を行わない状況で、p値に依存する直感的推論を模擬することで、研究者がパワー分析なしに再現性の強度を過大評価する様子を再現すること。

実験結果

リサーチクエスチョン

  • RQ1真のパワーが低い状況で、統計的有意性のフィルタがパワー推定値にどのように歪みをもたらすか。
  • RQ2統計的有意な結果が、心理的科学研究においてどれほど高い再現性の錯覚を生み出すか。
  • RQ3形式的なパワー計算なしにp < 0.05に依存するだけで、再現性に関する過剰な自信を持つことになるか。
  • RQ4有意な結果から導かれるパワー推定値と、実際の実験的研究における真のパワーとはどのように異なるか。
  • RQ5この過大評価が、心理言語学および心理学分野における知見の再現性にどのような影響を及えるか。

主な発見

  • 真の統計的パワーが低い場合、有意な結果から導かれるパワー推定値は系統的に過大評価され、再現性に対する誤った自信を生み出す。
  • 形式的なパワー分析がなくても、p < 0.05 にのみ依存する研究者は、再現の可能性を過大評価する傾向にある。
  • 心理言語学分野のメタアナリシスから抽出した10件の比較を用いた事例研究では、真のパワーが低いにもかかわらず、有意な結果が高めのパワー推定値を示している。
  • p値の閾値が非有意な結果を除外するため、真のパワーが低いことが明らかになるのを防ぎ、再現性の錯覚が維持される。
  • 真のパワーが50%未満である場合、推定パワーと真のパワーの差が最も顕著となり、再現性に対する過剰な自信が生じる。
  • このフィルタリング機構により、再現性に関する過剰な期待が研究間で自己強化され、継続する循環が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。