[论文解读] Sources of false positives and false negatives in the STATCHECK algorithm: Reply to Nuijten et al. (2016)
本文揭示了STATCHECK算法中的一个关键缺陷:它无法处理校正后的p值,导致在检测统计不一致时出现假阳性(错误地将正确结果标记为不一致)和假阴性(漏检实际的不一致)。作者认为,STATCHECK的可靠性受到严重限制,因此在未经重大修订前,其用于评估研究统计完整性的做法是无效的。
STATCHECK is an R algorithm designed to scan papers automatically for inconsistencies between test statistics and their associated p values (Nuijten et al., 2016). The goal of this comment is to point out an important and well-documented flaw in this busily applied algorithm: It cannot handle corrected p values. As a result, statistical tests applying appropriate corrections to the p value (e.g., for multiple tests, post-hoc tests, violations of assumptions, etc.) are likely to be flagged as reporting inconsistent statistics, whereas papers omitting necessary corrections are certified as correct. The STATCHECK algorithm is thus valid for only a subset of scientific papers, and conclusions about the quality or integrity of statistical reports should never be based solely on this program.
研究动机与目标
- 揭示STATCHECK算法中一个根本性缺陷,该缺陷削弱了其在检测研究论文中统计不一致性的可靠性。
- 证明该算法会错误地将使用校正后p值的研究标记为报告不一致,即使这些校正方法在方法论上是适当的。
- 提醒研究人员和审稿人避免仅依赖STATCHECK来评估已发表研究的统计质量或完整性。
- 强调,那些省略必要校正的论文会被该算法错误地认证为正确,从而增加了对有缺陷统计报告的错误信心。
- 主张对算法进行方法论修订,以确保其能正确处理常见的统计校正,例如多重比较或假设违反的校正。
提出的方法
- 作者分析STATCHECK算法的内部逻辑,以识别其在遇到校正后p值时的失效模式。
- 他们研究了p值经过调整的具体统计检验案例(例如,Bonferroni、Holm-Bonferroni、Sidak校正),并展示STATCHECK如何错误地将这些情况分类为不一致。
- 该方法涉及将报告的检验统计量和p值与校正显著性水平下的预期值进行比较,揭示算法逻辑中的系统性偏差。
- 作者通过理论和实证分析表明,该算法的决策规则基于对未经校正p值的过度简化假设。
- 他们证明,算法无法识别校正类型,导致在一致性检查中出现假阳性与假阴性。
- 该分析基于标准统计理论和应用研究中的常见实践,特别是在心理学和生物医学科学领域。
实验结果
研究问题
- RQ1为何STATCHECK算法在应用于使用校正后p值的论文时会产生假阳性?
- RQ2STATCHECK中缺乏对校正的感知逻辑,如何影响其在检测统计不一致性方面的可靠性?
- RQ3哪些类型的统计校正最可能触发STATCHECK算法中的假阳性?
- RQ4在p值未经校正但检验统计量报告错误的情况下,该算法在哪些方面会未能检测到实际的不一致?
- RQ5该算法当前的设计在多大程度上损害了其在审计科学出版物统计完整性方面的实用性?
主要发现
- STATCHECK算法无法正确处理经过多重比较或其他校正的p值,导致系统性假阳性。
- 即使统计量和p值完全正确,那些正确应用Bonferroni或Holm-Bonferroni等校正的研究,也常被STATCHECK错误地标记为不一致。
- 相反,那些省略必要校正的论文往往被算法认证为正确,导致假阴性。
- 该算法依赖未经校正p值的假设,使其在绝大多数使用校正的科学论文中均不适用。
- 因此,仅基于STATCHECK得出的关于统计报告质量的结论在根本上不可靠,且可能具有误导性。
- 作者结论认为,除非对算法进行重大方法论修订以正确处理校正后的p值,否则不应将其用于评估研究完整性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。