[论文解读] Pitfalls and potentials in simulation studies: Questionable research practices in comparative simulation studies allow for spurious claims of superiority of any method
本文揭示了在比较性模拟研究中,可疑研究实践(QRPs)如何错误地宣称方法上的优越性,即使该方法实际上并无性能提升。通过一项预先注册的模拟研究,作者证明了选择性报告、参数调优和结果切换等行为可使任何方法看似更优,凸显了在模拟研究中迫切需要预先注册、代码与数据共享以及方法透明化。
Comparative simulation studies are workhorse tools for benchmarking statistical methods. As with other empirical studies, the success of simulation studies hinges on the quality of their design, execution and reporting. If not conducted carefully and transparently, their conclusions may be misleading. In this paper we discuss various questionable research practices which may impact the validity of simulation studies, some of which cannot be detected or prevented by the current publication process in statistics journals. To illustrate our point, we invent a novel prediction method with no expected performance gain and benchmark it in a pre-registered comparative simulation study. We show how easy it is to make the method appear superior over well-established competitor methods if questionable research practices are employed. Finally, we provide concrete suggestions for researchers, reviewers and other academic stakeholders for improving the methodological quality of comparative simulation studies, such as pre-registering simulation protocols, incentivizing neutral simulation studies and code and data sharing.
研究动机与目标
- 揭示比较性模拟研究中的可疑研究实践(QRPs)如何导致方法优越性的虚假宣称。
- 说明即使一种方法在实际性能上并无优势,当使用选择性报告和参数调优等QRPs时,也可能显得更优。
- 强调当前模拟研究报告在方法严谨性和透明度方面的不足,这种不足削弱了可重现性和可重复性。
- 倡导采用更优标准,如预先注册模拟协议、中立基准测试,以及开放共享代码与数据。
- 提高研究人员、审稿人和出版商对有缺陷的模拟研究在影响科学与临床决策方面风险的认识。
提出的方法
- 开展一项预先注册的比较性模拟研究,将一种预期无性能优势的新预测方法与既有的成熟方法进行对比评估。
- 使用完全交互的回归模型(估测量 ~ 0 + 方法:情景)来正式检验不同方法与模拟条件下性能的差异。
- 对每个模拟条件下成对比较的p值应用单步多重检验校正(Hothorn等,2008),以调整多重比较带来的误差。
- 根据蒙特卡洛标准误要求确定模拟重复次数(B = 2000),通过一次小规模初始运行来估计最坏情况下的方差。
- 通过排除未收敛的模拟结果并报告失败率来处理收敛失败问题,仅在失败率超过10%时进行事后参数调整。
- 使用Brier评分和AUC等性能指标,结合箱形图与小提琴图进行可视化评估,并计算包括置信区间在内的汇总统计量。
实验结果
研究问题
- RQ1可疑研究实践在多大程度上可导致对一种无实际性能优势方法的优越性虚假宣称?
- RQ2选择性报告、参数调优和结果切换如何扭曲模拟研究中统计方法性能的感知?
- RQ3当前模拟研究设计与报告中的关键方法论缺陷是什么,这些缺陷如何削弱可重现性与可重复性?
- RQ4预先注册与开放共享代码和数据如何提升比较性模拟研究的可信度与透明度?
- RQ5研究人员、审稿人和出版商可采取哪些具体措施来降低模拟研究结果出现偏差或误导的风险?
主要发现
- 通过使用选择性报告和参数调优等可疑研究实践,一种本无预期性能优势的新预测方法被成功呈现为优于既有的成熟方法。
- 研究显示,即使一种方法本身并无优势,当应用QRPs时,其在12.5%的模拟条件下仍能获得统计上显著的优越性宣称。
- 为确保Brier评分估计器的蒙特卡洛标准误低于0.0001,确定模拟重复次数为2000次。
- 收敛失败通过系统性排除未收敛模拟并报告失败率来处理,仅在失败率超过10%时进行事后参数调整。
- 采用包含方法与模拟条件之间交互项的完全交互回归模型,实现了对性能差异的正式、统计严谨的比较。
- 研究发现,当前期刊政策往往未能强制执行模拟研究的方法严谨性,由于缺乏模拟协议的预先注册和代码/数据共享,导致偏差难以被发现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。