Skip to main content
QUICK REVIEW

[论文解读] The illusion of power: How the statistical significance filter leads to overconfident expectations of replicability

Shravan Vasishth, Andrew Gelman|arXiv (Cornell University)|Feb 2, 2017
Social and Intergroup Psychology被引用 7
一句话总结

该论文表明,仅发布统计显著结果(p < 0.05)的普遍做法会制造出高可重复性的错觉,即使实际统计功效很低。通过仅从显著结果中推导并应用统计功效估计,研究人员会高估可重复性,从而在心理学和心理语言学研究中产生过度自信的预期。

ABSTRACT

We show that publishing results using the statistical significance filter---publishing only when the p-value is less than 0.05---leads to a vicious cycle of overoptimistic expectation of the replicability of results. First, we show through a simple derivation that when true statistical power is relatively low, computing power based on statistically significant results will lead to overestimates of power. Then, we present a case study using 10 experimental comparisons drawn from a recently published meta-analysis in psycholinguistics (J\ager et al., 2017). We show that the statistically significant results yield an illusion of replicability, i.e., an illusion that power is high. This illusion holds even if the researcher doesn't conduct any formal power analysis but just uses statistical significance to informally assess robustness of results.

研究动机与目标

  • 调查仅发布统计显著结果的做法如何扭曲对可重复性的预期。
  • 证明当实际功效较低时,仅从显著结果中计算出的功效会系统性地高估真实功效。
  • 揭示即使没有正式的功效分析,仅依赖p值也会产生可重复性的错觉。
  • 强调这种高估对心理学和心理语言学领域科学发现可信度与可重复性的影响。

提出的方法

  • 推导在真实功效较低条件下,观察到的p值与估计统计功效之间的数学关系。
  • 将推导出的公式应用于案例研究,从显著结果中计算功效估计。
  • 使用来自一篇已发表的心理语言学元分析(Jäger et al., 2017)的10个实验比较结果作为功效估计的实证输入。
  • 将仅从显著结果中得出的功效估计值,与原始研究中效应量和样本量所隐含的实际功效进行比较。
  • 证明当真实功效较低时,基于p < 0.05结果的功效估计值会持续被高估。
  • 通过仅依赖p值的非正式推断,模拟研究人员在无正式功效分析的情况下可能过度高估稳健性的情形。

实验结果

研究问题

  • RQ1当真实功效较低时,统计显著性筛选如何扭曲统计功效的估计?
  • RQ2在心理学研究中,显著结果在多大程度上制造了高可重复性的错觉?
  • RQ3在无正式功效计算的情况下,仅非正式依赖p < 0.05是否会导致对可重复性的过度自信预期?
  • RQ4从显著结果中推导出的功效估计值与真实功效在实际经验研究中相比如何?
  • RQ5这种高估对心理语言学和心理学研究发现可重复性有何影响?

主要发现

  • 当真实统计功效较低时,仅从显著结果中推导出的功效估计值会系统性地被高估,从而产生对可重复性的虚假信心。
  • 即使没有正式的功效分析,仅依赖p < 0.05来判断稳健性的研究人员也会高估复制的可能性。
  • 基于心理语言学元分析中10个比较结果的案例研究显示,显著结果虽暗示了被高估的功效估计,但真实功效却很低。
  • 这种可重复性的错觉持续存在,因为p值阈值过滤掉了非显著结果,而这些结果本应揭示出低功效的事实。
  • 当真实功效低于50%时,估计功效与真实功效之间的差异最为显著,导致对可重复性的过度自信。
  • 这种筛选机制形成了一种自我强化的循环,使得对复制的过度自信预期在各研究间持续传递。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。