Skip to main content
QUICK REVIEW

[论文解读] The statistical significance filter leads to overconfident expectations of replicability

Shravan Vasishth, Andrew Gelman|arXiv (Cornell University)|Feb 2, 2017
Statistical Methods and Inference参考文献 17被引用 6
一句话总结

本文表明,仅发布 p < 0.05 的结果(即统计显著性筛选)会导致在低统计功效的研究中因效应量夸大而系统性高估对可重复性的预期。通过分析推导和一个心理语言学案例研究,本文显示,显著结果的 p 值会产生被夸大的统计功效估计值,从而在未进行正式功效分析的情况下,制造出一种虚假的稳健性错觉。

ABSTRACT

We show that publishing results using the statistical significance filter---publishing only when the p-value is less than 0.05---leads to a vicious cycle of overoptimistic expectation of the replicability of results. First, we show analytically that when true statistical power is relatively low, computing power based on statistically significant results will lead to overestimates of power. Then, we present a case study using 10 experimental comparisons drawn from a recently published meta-analysis in psycholinguistics (J\\"ager et al., 2017). We show that the statistically significant results yield an illusion of replicability. This illusion holds even if the researcher doesn't conduct any formal power analysis but just uses statistical significance to informally assess robustness (i.e., replicability) of results.

研究动机与目标

  • 调查仅发布统计显著结果(p < 0.05)的做法如何扭曲研究人员对可重复性的预期。
  • 从理论上证明,当真实统计功效较低时,从显著结果中推导出的统计功效估计值会系统性地被高估。
  • 通过心理语言学案例研究说明,小样本中显著结果会制造出一种可重复性的错觉,即使未进行正式的功效分析。
  • 挑战一种普遍假设,即更低的 p 值意味着更高的可重复性,指出这种观点是基于显著性筛选的误解。
  • 主张放弃基于 p < 0.05 的统计功效概念,转而使用基于领域知识的效应量范围来设计研究。

提出的方法

  • 推导原假设下 p 值的抽样分布,表明其服从 Uniform(0,1) 分布。
  • 使用非非中心 t 分布来建模备择假设下 t 统计量的抽样分布,从而实现统计功效估计。
  • 应用从观测 t 统计量估计统计功效的公式:G_{zp}(α) = 1 − Φ(z_α − z_p),其中 z_p 为观测到的 z 分数。
  • 分析观测 p 值与估计统计功效之间的关系,表明更高的 t 统计量会导致更高的估计统计功效,即使真实统计功效很低。
  • 对心理语言学元分析中的 10 个实验比较(Jäger 等,2017)进行案例研究,以在真实数据中展示可重复性的错觉。
  • 通过模拟和分析建模表明,显著结果的效应量估计值会系统性地被夸大(即类型 M 错误),尤其在低统计功效设计中更为明显。

实验结果

研究问题

  • RQ1统计显著性筛选如何导致在已发表研究中对可重复性的过度自信预期?
  • RQ2当真实统计功效较低时,显著结果的 p 值在多大程度上高估了真实统计功效?
  • RQ3仅依赖统计显著性是否可能在实验结果中制造出虚假的稳健性和可重复性感知?
  • RQ4原始 p 值的大小与成功复制的概率之间有何关系?这一关系是否具有误导性?
  • RQ5效应量夸大(类型 M 错误)对心理学和心理语言学等领域的研究设计与复制工作有何影响?

主要发现

  • 当真实统计功效较低时,统计显著性筛选会导致对统计功效的高估,因为显著结果来自抽样分布的上尾,从而夸大了效应量估计值。
  • 显著结果中观测到的 t 统计量所对应的统计功效估计值是 t 值的单调递增函数,即使真实统计功效很低,也会造成高可重复性的虚假印象。
  • 在心理语言学案例研究中,10 个 p < 0.05 的已发表比较显示出被夸大的效应量和被高估的统计功效,尽管样本量较小(n = 20–40),却制造出可重复性的错觉。
  • 开放科学协作(Open Science Collaboration)报告的原始 p 值与复制成功率之间的相关性,被误认为是更低 p 值能预测更好可重复性的证据,实际上这反映了相同的偏差。
  • 许多心理学和神经科学研究的统计功效较低(例如,神经科学中为 8–31%,行为科学中平均为 24%),但研究人员仍因显著性筛选而对可重复性抱有过度自信。
  • 基于已发表结果的正式统计功效分析会系统性地高估真实统计功效,因为其基于的是相同的、被显著效应估计值所偏倚的样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。